Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
중국 StepFun AI가 공개한 30억(3B) 파라미터급 LLM 기반 음성 편집 모델입니다. 단순히 텍스트를 음성으로 바꾸는 TTS를 넘어, 이미 생성되거나 녹음된 음성의 감정·말투·부수적 발화(한숨, 웃음, 헛기침 등)를 텍스트 지시만으로 다시 편집하는 것이 핵심 기능이라고 저장소가 소개합니다. 강화학습(RL) 기반 학습으로 제로샷 음성 클로닝과 감정·스타일 제어에서 Minimax, Doubao 등 경쟁 시스템 대비 우수한 성능을 보였다고 문서가 밝히며, 표준 GPU에서 약 12GB VRAM으로 구동 가능해 개인 워크스테이션에서도 시도해볼 수 있는 규모입니다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS