Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
영상과 소리를 한 번의 추론으로 동시에 만들어 내는 오픈소스 비디오-오디오 생성 파운데이션 모델입니다. 영상을 먼저 만들고 소리를 나중에 붙이는 캐스케이드 방식과 달리, 사전학습된 비디오 타워와 오디오 타워를 양방향 크로스 어텐션으로 융합한 비대칭 듀얼 타워 구조로 두 모달리티를 함께 생성해 오차 누적을 줄입니다. 다국어 립싱크와 환경음 재현에서 오픈소스 모델 가운데 앞선 수치를 보고하며, 모델 가중치와 추론 코드뿐 아니라 학습 파이프라인, LoRA 파인튜닝 스크립트, 평가 코드까지 Apache 2.0으로 공개했습니다.