Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
TIGER(Time-frequency Interleaved Gain Extraction and Reconstruction)는 칭화대학교 연구진이 ICLR 2025에 발표한 경량 음성·사운드 분리 모델이다. 주파수 대역을 나누어 압축하고, 다중 스케일 선택적 주의(MSA) 모듈과 전역 주파수-프레임 주의(F³A) 모듈로 시간·주파수 정보를 함께 포착해, TF-GridNet 대비 파라미터 94.3%, 연산량 95.3%를 줄이면서도 근접한 분리 성능을 낸다. 잡음·잔향·화자 겹침을 반영한 EchoSet으로 평가했으며, 다화자 음성 분리는 물론 대사·효과음·음악이 섞인 영화 사운드 분리에도 쓸 수 있다. 더 가벼운 small·tiny 버전도 공개되어 온디바이스 적용에 적합하며, MIT 라이선스로 배포된다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI