Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OmniVoice는 Next-gen Kaldi로 알려진 k2-fsa 팀이 공개한 제로샷 TTS 모델로, 600개가 넘는 언어를 하나의 모델로 합성한다. 확산 언어모델(diffusion language model) 계열 구조를 채택해 품질과 속도를 함께 잡았고, 3~10초짜리 참조 음성만으로 목소리를 복제하거나 참조 음성 없이 성별·나이·음높이·악센트 같은 속성을 글로 지정해 목소리를 설계할 수 있다. 저자원 언어까지 커버 범위를 넓힌 오픈 TTS가 드물다는 점에서, 다국어 음성 서비스를 준비하는 쪽이 먼저 확인해볼 만한 선택지다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS