Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
텐센트 Hunyuan 팀이 2026년 9월 공개한 1.5B 파라미터 음성 생성·편집 파운데이션 모델이다. 수백만 시간 분량의 오디오로 학습했으며, 제로샷·지시문 기반 TTS부터 발화 내용 수정, 피치·속도·음량 조절, 감정·음색 변환, 억양 제거, 잡음 제거, 화자·음원 분리까지 모든 작업을 하나의 자연어 지시 인터페이스로 처리한다. 고품질용 AuK와 4스텝 추론용 증류 모델 AuK-Flash 두 가지가 있고, 멀티모달 인코더로 Qwen2.5-Omni-3B를 함께 내려받아 사용한다. CLI·Python API·Gradio 데모·ComfyUI 노드와 파인튜닝 파이프라인을 포함하며, 코드와 가중치 모두 MIT 라이선스로 공개됐다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS