Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Kokoro-82M을 증류해 만든 8.07M 파라미터 영어 텍스트-음성 변환(TTS) 모델이다. Kokoro의 af_heart 음성 하나만 지원하며, int8 ONNX 파일 하나가 약 9MB로 Kokoro(325MB)보다 훨씬 작다. README에 따르면 CPU 단일 스레드에서 실시간 대비 약 18배 속도로 동작하고, 200개 문장 평가에서 UTMOS 4.41(Kokoro 4.52), 단어 오류율 5.7%를 기록했다. 텍스트 측과 디코더를 고정된 교사 모델에 맞춰 나눠 학습한 방식이며, 학습 코드와 논문, 브라우저용 misaki.js 음소 변환도 함께 공개되어 있다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS