Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
샤오미 연구팀(xiaomi-research)이 2026년 8월 공개한 통합 오디오 장면 생성 프레임워크다. 사전학습된 LLM(Qwen3-1.7B)과 DashengTokenizer를 백본으로 삼고, 토큰마다 조건부 flow matching을 적용하는 자기회귀 방식으로 음성·음악·효과음·환경음이 한데 섞인 16kHz 오디오 장면을 가변 길이로 생성한다. 입력은 caption, asr, speech, sfx, music, env 등 특수 토큰으로 장면 요소를 나눠 기술하는 구조화 캡션이며, 학습된 stop head가 출력 길이를 결정한다. README 기준 9개 언어와 감정 제어를 지원하고 Seed-TTS 평가에서 전용 TTS에 근접한 음성 명료도를 보인다고 밝힌다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI