Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Dia 모델로 알려진 Nari Labs가 공개한 Qwen3-TTS 1.7B CustomVoice 전용 고성능 서빙 엔진이다. 새 음성 모델이 아니라 기존 Qwen3-TTS를 단일 NVIDIA H100에서 빠르게 서비스하는 데 초점을 맞췄으며, 초당 10건 요청에서 p95 첫 오디오 시간(TTFA) 50ms 미만, 초당 20건에서도 80ms 미만을 유지한다고 밝혔다. OpenAI Audio Speech 형식의 HTTP API와 텍스트를 점진적으로 보내는 WebSocket 스트리밍을 제공하고, 지연·균형·처리량 세 가지 프로파일로 스케줄링을 조정한다. H100과 CUDA 13.0 호환 드라이버가 필요하고 영어 위주로만 테스트됐다는 제약이 있다. 라이선스는 Apache-2.0이다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS