Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
대화체 음성 생성에 초점을 맞춘 80억 파라미터 규모의 텍스트-음성 변환 모델입니다. Sesame CSM 구조에서 출발한 RVQ 트랜스포머로, Llama 3.2 계열 백본이 텍스트와 오디오 토큰을 번갈아 받아 처리하고 3억 파라미터급 디코더가 프레임마다 상위 코드북을 자기회귀로 예측합니다. 오디오 토크나이저는 Mimi를 쓰고 코드북 32개를 사용합니다. 저장소에는 추론 코드와 모델 정의, 로컬 실행 절차가 담겨 있으며 가중치는 허깅페이스에서 내려받습니다. 현재 영어만 지원합니다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS