Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
HunyuanVideo-Foley는 텐센트 훈위안이 공개한 텍스트-비디오-투-오디오(TV2A) 폴리 사운드 생성 모델이다. 멀티모달·유니모달 트랜스포머 블록을 결합한 하이브리드 확산 구조로, 영상과 텍스트 프롬프트를 함께 조건으로 삼아 장면에 동기화된 48kHz 오디오를 생성한다. Synchformer 기반 시간 정렬과 게이트 변조로 프레임 단위 오디오-영상 동기화 정밀도를 높였으며, MovieGen-Audio-Bench와 Kling-Audio-Eval 벤치마크에서 MMAudio, ThinkSound 등 기존 모델 대비 전 지표 최고 점수를 기록했다고 밝힌다. 20GB VRAM의 XXL과 16GB VRAM의 XL 두 모델을 제공하며, 오프로딩 시 각각 12GB·8GB까지 낮출 수 있다.
openai
99개+ 언어 지원 범용 음성 인식 모델 - GitHub 96K 스타
coqui-ai
1100개 이상 언어를 지원하는 오픈소스 음성 합성 딥러닝 도구 모음
suno-ai
Suno AI의 텍스트-오디오 생성 모델 - 다국어 음성, 음악, 효과음 생성
RVC-Project
10분 이하 음성으로 학습하는 retrieval 기반 음성 변환 WebUI