Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
8.6M 파라미터(약 34MB) 규모의 튀르키예어 전용 텍스트-음성 변환(TTS) 모델이다. GPU나 CPU에서 오프라인으로 동작하며, README 기준 Freya-TR-Eval 495문장에서 단어 오류율 0.92%를 기록했다고 밝힌다. RTX 4090에서 단일 요청은 실시간 대비 약 440배, 첫 오디오까지 약 4ms가 걸린다. 숫자·날짜·금액·단위·약어를 읽어 주는 normalizer-tr 전처리, 스트리밍 출력, 단어별 타이밍 정보를 제공하고, 내장 스케줄러 Playhead가 여러 스레드의 요청을 한 모델에서 묶어 처리한다. 음성은 하나뿐이며 음성 복제·감정 제어는 지원하지 않는다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS