Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
알리바바가 공개한 오디오 처리·생성 통합 프레임워크입니다. 음성 복원, 목표 화자 추출, 음원 분리, 음색 변환, 자연어 질의 기반 음원 분리, 오디오 토크나이제이션, 오디오 편집을 작업별 개별 모델이 아니라 하나의 디코더 온리 자기회귀 언어모델 구조로 다루며, 어떤 작업인지 명시하는 프롬프트 없이도 동작하도록 설계했습니다. WavLM·HuBERT 계열 특징 추출기와 자체 이산 코덱 H-Codec, 언어모델을 하나의 파이프라인으로 묶은 점이 구조적 특징입니다. 음성뿐 아니라 음악과 일반 음향 이벤트까지 대상으로 하고, 2026년 5월에는 스테레오 인코딩과 모노-스테레오 공간화를 지원하는 HCodec-Spatial을 추가로 공개했습니다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI