Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Irodori-TTS는 Flow Matching 기반 음성 합성 모델의 학습·추론 코드를 공개한 프로젝트다. DACVAE의 연속 잠재 표현을 생성 대상으로 삼고 Rectified Flow Diffusion Transformer 구조를 사용한다. 참조 음성으로 zero-shot 음성 복제를 수행하며, 텍스트·참조 음성·캡션 텍스트 세 가지를 함께 조건으로 받아 목소리 정체성과 감정·스타일을 조절하는 보이스 디자인이 가능하다. 입력 문장에 넣은 이모지로 발화 톤과 비언어적 표현을 바꾸는 방식이 특징이다. 최대 120초 참조 오디오, 출력 길이 자동 예측, LoRA 파인튜닝, CLI와 Gradio WebUI를 지원한다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS