Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
MMAudio는 영상과 텍스트를 입력으로 받아 장면에 동기화된 오디오를 생성하는 비디오-투-오디오 합성 모델이다. 일리노이대 어배너-섐페인과 소니 AI, 소니 그룹이 함께 발표해 CVPR 2025에 채택됐다. 핵심 아이디어는 멀티모달 공동 학습으로, 오디오-비주얼 데이터셋과 오디오-텍스트 데이터셋을 한꺼번에 사용해 영상-음향 짝 데이터가 부족한 문제를 완화한다. 여기에 별도의 동기화 모듈이 생성된 소리를 프레임 단위 움직임에 맞춰 정렬하기 때문에, 발소리나 충돌음 같은 폴리 사운드의 타이밍이 자연스럽게 맞아떨어진다. 플로우 매칭 기반 구조라 추론이 빠르고 사전 학습 가중치와 허깅페이스 데모, Colab 노트북이 모두 공개돼 있다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI