Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Soul AI Lab이 공개한 추론 코드베이스로, 텍스트만으로 여러 화자가 등장하는 멀티턴 팟캐스트 형식의 긴 대화 음성을 생성하는 데 특화되어 있다. 팟캐스트 전용 기능뿐 아니라 표준 단일 화자 TTS 작업에서도 우수한 성능을 보이는 범용 음성 합성 모델이다. 중국어와 영어는 물론 쓰촨어, 허난어, 광둥어 등 중국 방언 간 제로샷 음성 복제를 지원하며, 웃음·한숨·숨소리·기침·목 가다듬기 같은 준언어적 표현을 세밀하게 제어할 수 있어 실제 대화에 가까운 자연스러운 억양을 만들어낸다. vLLM 가속을 적용한 도커 이미지와 CLI, WebUI 인터페이스를 함께 제공해 배포와 실험이 용이하며, Apache-2.0 라이선스로 공개되어 있다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS