Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
zeroweight-ai가 공개한 베트남어 전용 경량 TTS로, 202M 파라미터 모델을 ONNX Runtime으로 구동해 GPU 없이 CPU에서 실시간보다 빠르게(RTF 약 0.5배) 음성을 만든다. 스트리밍 모드에서 첫 오디오 청크가 약 70ms 만에 나오며, 성조와 영어 코드 스위칭, 날짜·숫자 표기도 처리한다. 자체 벤치마크 ZeroBench-TTS에서 WER 1.03%로 비교 대상 오픈 모델(OmniVoice 4.13%)보다 낮은 오류율을 보고했다. 다만 레퍼런스 음성에서 화자 잠재 벡터를 만드는 보이스 인코더는 공개되지 않아, 이 저장소만으로는 새 목소리를 클로닝할 수 없고 자사 플랫폼에서 받은 보이스 파일을 불러와 쓰는 구조다. 라이선스는 MIT다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS