Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
중국 Zhipu AI(Z.ai)가 공개한 오픈소스 TTS 시스템으로, 텍스트를 스피치 토큰으로 변환하는 자기회귀 모델과 토큰을 파형으로 복원하는 디퓨전 모델을 결합한 2단계 구조를 사용한다. 3~10초 분량의 짧은 프롬프트 오디오만으로 화자의 목소리를 제로샷 복제할 수 있으며, GRPO 기반 멀티 리워드 강화학습으로 발음 정확도, 화자 유사도, 운율 표현력을 동시에 최적화한다. 기본 주파수(F0) 제약을 반영한 음성 토크나이저를 도입해 100k시간 규모의 비교적 적은 학습 데이터로도 여러 오픈소스 벤치마크에서 경쟁력 있는 성능을 낸다. 스트리밍 추론과 음소 단위 제어, 중국어-영어 혼용 발화를 지원하며 Apache-2.0 라이선스로 상업적 이용도 허용한다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS