Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
DiffRhythm(谛韵)은 잠재 확산(latent diffusion) 구조로 최대 285초 분량의 완전한 곡을 짧은 시간에 생성하는 오픈소스 음악 생성 모델이다. 확산 기반으로 풀렝스 곡을 생성한 초기 사례 중 하나로 소개되었으며, 텍스트 스타일 프롬프트만으로 보컬과 반주가 함께 있는 노래 또는 순수 반주곡을 만들 수 있다. 곡의 구조와 스타일을 이해해 이어 붙이기(continuation)와 부분 편집 기능도 지원하며, 이후 버전에서는 반복·누락 문제를 줄이고 악기 구성을 더 풍부하게 개선했다. macOS를 포함한 다양한 환경에서 로컬 구동이 가능하고 Hugging Face Space 데모로도 체험할 수 있다. Apache 2.0 라이선스로 배포되어 연구와 제품 적용에 제약이 적다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI