Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
알리바바 다모 아카데미(DAMO Academy) NLP팀이 공개한 비디오 대형언어모델로, 시공간 모델링과 오디오 이해를 함께 강화한 것이 핵심이다. 영상 속 화면 변화(공간-시간 관계)뿐 아니라 음성·배경음까지 함께 인식해 답변하는 오디오-비주얼(AV) 버전을 별도로 제공하는 것이 특징으로, 순수 영상 이해에 그치는 다른 모델들과 차별화된다. 공개 당시 VideoMME와 MLVU 리더보드에서 7B급 최고 성능(Top-1)을 기록했으며, 7B부터 8x7B MoE, 72B까지 다양한 규모의 체크포인트를 Hugging Face에 공개했다. 학습·평가·서빙 코드 전체가 오픈소스로 제공되고 자체 제작한 Multi-Source Video Captioning(MSVC) 데이터셋도 함께 배포된다. Apache 2.0 라이선스로 배포되며, 후속작 VideoLLaMA3와는 별도 계보의 독립 프로젝트로 이어지고 있다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델