Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
SGLang-Omni는 TTS·음성인식·음악 생성 등 오디오 모델 서빙에 특화된 멀티스테이지 추론 프레임워크입니다. 전처리, 인코더, 자동회귀 엔진, 토커, 디코더, 보코더로 이어지는 파이프라인을 단계별로 스케줄링하고, SGLang의 고성능 추론 엔진과 결합해 동작합니다. 2026년 8월 가사·설명 텍스트로 32kHz 스테레오 곡을 생성하는 MiniMax Music 3를 출시 당일 지원했고, Higgs Audio v3, MOSS-TTS, Qwen3 계열 모델을 OpenAI 호환 /v1/audio/speech, /v1/audio/transcriptions API로 서빙합니다. NVIDIA CUDA를 기본 지원하며 Intel XPU는 실험적으로 지원합니다. 라이선스는 Apache-2.0입니다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI