Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
차세대 Kaldi 프로젝트인 k2-fsa가 공개한 ZipVoice는 플로우 매칭(flow matching) 방식을 사용하는 경량 제로샷 TTS 모델이다. 파라미터 수가 1억 2,300만 개에 불과해 화자별 재학습 없이도 짧은 참조 음성만으로 화자 유사도, 명료도, 자연스러움에서 준수한 성능을 낸다고 보고됐다. 단일 화자 합성 모드 외에 두 화자가 주고받는 대화 음성을 생성하는 ZipVoice-Dialog와 스테레오 채널로 분리해 출력하는 ZipVoice-Dialog-Stereo 변형을 함께 제공하며, 추론 속도를 높인 distill 버전도 있다. NVIDIA Triton과 sherpa-onnx를 통한 CPU 배포 가이드를 제공해 실제 서비스 적용을 염두에 뒀다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS