Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
LuxTTS는 k2-fsa의 ZipVoice 아키텍처를 기반으로 경량화한 음성 복제 TTS 모델이다. 동일 구조를 4단계 샘플링으로 증류하고 개선된 샘플링 기법과 48kHz 전용 보코더를 적용해, 대부분의 TTS 모델이 24kHz에 머무는 것과 달리 더 선명한 음질을 낸다. 단일 GPU 기준 실시간 대비 약 150배 속도로 동작하고 CPU에서도 실시간보다 빠르며, 약 1GB VRAM만으로 구동 가능해 일반 로컬 GPU에서도 사용할 수 있다. 최소 3초 분량의 참조 오디오만 있으면 화자 목소리를 복제할 수 있다. Hugging Face 데모와 Colab 노트북을 공식 제공하며, ComfyUI 노드·ONNX 추론·전용 Gradio UI 등 커뮤니티 확장 도구도 다수 존재한다. 모델과 코드 모두 Apache-2.0 라이선스로 공개됐다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS