Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
서북공업대학 ASLP 연구실이 공개한 저지연 스트리밍 제로샷 음성 변환(VC) 시스템이다. 플로우 매칭 기반 전작 MeanVC의 작은 청크 품질 저하와 저품질 참조 음성 민감성을 개선했다. Future-Receptive Chunking(FRC)과 Universal Timbre Token Encoder(UTTE)를 도입해 40ms 청크 기준 종단 간 지연 110ms를 보고한다. 스트리밍 ASR로 내용 특징을 뽑고 4층 DiT 디코더가 1-step으로 멜 스펙트로그램을 만든 뒤 Vocos 보코더로 음성을 합성한다. 파라미터는 약 18M이며 화자별 파인튜닝 스크립트와 CPU 전용 Windows 실행 파일을 제공한다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI