Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Marvis-Labs가 공개한 온디바이스 지향 실시간 스트리밍 음성 합성 모델입니다. Sesame의 대화형 음성 모델 CSM-1B 구조와 Kyutai의 Mimi 코덱을 기반으로, 250M 파라미터 멀티모달 백본과 60M 파라미터 오디오 디코더를 합쳐 총 약 310M 규모로 구성했다고 저장소가 밝힙니다. 양자화 시 500MB까지 줄어들어 휴대폰 수준의 기기에서도 구동할 수 있는 크기이며, 텍스트를 정규식 기반으로 잘라 순차 처리하는 대신 문장 전체 맥락을 유지한 채 스트리밍 생성한다는 점을 특징으로 내세웁니다. 10초 분량의 참조 음성만으로 음색을 복제할 수 있어, 실시간 음성-음성(STS) 변환처럼 지연 시간이 중요한 온디바이스 대화형 애플리케이션을 주 타깃으로 합니다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS