Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Audio8 TTS는 Audio8-AI가 공개한 6억(0.6B) 파라미터 규모의 다국어 제로샷 음성 합성 모델이다. Fish Audio S2 Pro에서 영감을 받은 DualAR(슬로우 AR·패스트 AR) 구조를 사용하며, 슬로우 AR이 프레임당 시맨틱 토큰 하나를 예측하고 패스트 AR이 나머지 코덱 코드북을 생성한다. 44.1kHz 오디오 코덱을 내장해 별도 보코더 없이 참조 음성 인코딩과 파형 디코딩을 처리한다. 영어·중국어(광둥어 포함)·일본어·한국어·독일어·프랑스어 등 11개 언어를 우선 지원하며, CUDA GPU 없이도 동작하는 INT4 양자화 ONNX 런타임과 SGLang Omni 기반 OpenAI 호환 서빙 어댑터를 함께 제공한다. 더 작은 1억(0.1B) 파라미터 버전도 추가로 공개됐다. 코드 저장소는 Apache-2.0이지만, 모델 가중치는 연 매출 200만 달러 미만 사업자의 상업적 사용까지 무료로 허용하는 별도의 Audio8 Community License가 적용된다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS