Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
FireRedTeam이 2026년 8월 13일 공개한 통합 음성 생성·편집 모델로, 의미 정보를 강화한 연속형 음성 표현 위에 구축됐다. 24개 언어와 21개 중국어 방언에서 제로샷 보이스 클로닝을 지원하는 FireRedTTS3-Base, 그리고 자연어 설명만으로 새 목소리를 만드는 보이스 디자인과 음성 편집을 하나의 모델로 처리하는 FireRedTTS3-Instruct 두 가지로 제공된다. 편집은 단어 삽입·삭제·치환 같은 의미 편집과 속도·피치·볼륨 같은 음향 편집을 자유 형식 지시문으로 수행한다. README 기준 MiniMax-MLS-Test 평균 WER/CER 3.754%, Seed-TTS-eval 클로닝 평균 WER/CER 3.04%를 보고했다. 코드는 Apache-2.0이다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS