Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
AutoArk가 공개한 GPA(General Purpose Audio)는 음성 인식과 음성 합성, 음성 변환을 하나의 자기회귀 트랜스포머로 묶는 통합 오디오 모델이다. 과제마다 모델을 따로 두는 대신 오디오 이해와 생성을 같은 구조에서 다루는 접근을 택했고, 2026년 4월 공개된 v1.5는 단일 모델로 음성 인식과 합성 전용 모델에 근접한 성능을 보고했다(음성 변환은 로드맵 단계). ONNX 런타임과 CLI, FastAPI 서비스, 브라우저 UI를 함께 배포하며, INT8·INT4로 양자화한 경량 TTS 런타임을 별도로 분리해 엣지 기기 배포까지 염두에 뒀다. 모델 가중치와 평가 결과는 Hugging Face와 논문으로 공개돼 있다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI