Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Ampixa가 공개한 초소형 신경망 TTS 음성 모음으로, 음성당 파라미터가 29만~230만 개 수준이다. espeak-ng로 음소를 얻은 뒤 지속시간 모델·음향 모델·디코더가 차례로 오디오를 만드는 구조로, 클라우드나 NPU 없이 약 3달러짜리 ESP32-S3에서 실시간 합성(SIMD 커널 사용 시 RTF 0.383)이 가능하고 브라우저에서는 WebAssembly로 서버 없이 동작한다. 가장 작은 heart-nano는 int8 가중치 337KB다. 브라우저 데모 기준 16개 언어 30개 음성을 제공하고 pip·npm·Arduino 라이브러리로 배포된다. README는 비영어 음성에 대한 청취 테스트가 아직 없다고 밝힌다. 추론 런타임은 MIT, 나머지는 GPL-3.0이다.
CorentinJ
5초 음성으로 즉시 목소리 복제 가능한 실시간 TTS 시스템
RVC-Boss
1분 음성으로 고품질 TTS 모델 훈련 가능한 음성 변환 웹UI
2noise
대화형 AI를 위한 자연스러운 음성 생성, 중영 이중언어 지원
babysor
5초 음성으로 목소리를 복제하는 실시간 음성 클로닝 TTS