Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
저품질 음성을 48kHz로 복원하는 경량 음성 향상·대역폭 확장 모델입니다. 8kHz부터 48kHz까지 어떤 샘플레이트로 들어와도 처리하며, 모델 크기는 약 50MB, VRAM은 500MB 수준으로 A100에서 약 5000배 실시간, CPU에서도 수십 배 실시간 속도를 낸다고 저장소가 밝힙니다. Vocos 아키텍처를 대역폭 확장에 맞춰 적용하고 Linkwitz-Riley 크로스오버에서 착안한 리파이너를 더한 구조이며, v2 논문은 Interspeech 2026 메인 트랙에 채택됐습니다. TTS 출력 후처리, 통화 음질 개선, 학습 데이터셋 복원 용도를 주된 쓰임새로 제시합니다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI