Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
FireRedTeam이 2026년 8월 공개한 범용 오디오 언어 모델이다. 9B 파라미터 LLM 하나를 공유하되, 이해는 오디오 인코더가, 생성은 RedAE 경로가 맡도록 연속 표현을 분리한 구조가 핵심이다. 한 모델로 음성 인식, 오디오 이해·추론, 제로샷·지시형 TTS, 음성 내용·음향(피치·속도·음량) 편집, 최대 약 1시간 녹음의 타임스탬프 기반 탐색까지 처리한다. README 기준 MMAU test-mini 82.0, MMAU test 80.9, MMSU 83.3을 기록했고 LibriSpeech clean WER은 0.67이다. ASR을 제외한 생성·이해 작업은 중국어와 영어만 지원한다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI