Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Sony Research가 공개한 논문 'Iterative Audio Separation with Mixture Consistency via MIMO Model Extension'의 공식 PyTorch 구현이다. 단일 스텝 오디오 분리 모델을 혼합 일관성(mixture consistency)을 갖는 반복 분리 과정으로 바꾸는 범용 프레임워크를 제안한다. BS-RoFormer, Mel-RoFormer, SCNet 등 음악 소스 분리 백본을 Hydra 설정과 Accelerate 기반 분산 학습(DDP)으로 지원한다. MUSDB18-HQ로 학습한 사전학습 가중치를 함께 배포하며, README 표 기준 72M급 BS-RoFormer의 보컬/반주 SDR 11.40/18.48 대비 MIMO BS-RoFormer는 11.62/19.04를 기록했다. museval·BSSEval 기반 전체 트랙 및 슬라이딩 윈도우 평가 파이프라인과 Singularity 컨테이너 환경도 제공한다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI