Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Meta가 공개한 오디오용 Segment Anything 모델로, 여러 소리가 섞인 음원에서 원하는 소리 하나를 분리해 대상(target)과 나머지(residual) 트랙으로 돌려준다. 'man speaking' 같은 짧은 텍스트, 영상 프레임과 마스크를 쓰는 시각 프롬프트, 소리가 나는 시간 구간을 지정하는 스팬 프롬프트를 지원하며 텍스트만으로 구간을 자동 예측할 수도 있다. 오디오-비주얼 인코더 PE-AV를 기반으로 하고, CLAP·Judge·ImageBind로 여러 후보를 재순위화해 품질을 높인다. small/base/large 3종과 -tv 변형을 제공하며, large의 주관 평가 점수는 음악 4.22, 전문 악기 4.49다(README 기준).
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI