Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
LLaVA-OneVision-2는 LMMs-Lab이 공개한 LLaVA-OneVision 계열의 차세대 완전 오픈소스 멀티모달 모델로, 이미지·장편 비디오·3D 공간 이해를 단일 8B 아키텍처로 통합합니다. HEVC 압축 방식에서 착안한 코덱 정렬 비전 인코더(OneVision-Encoder)가 정지 배경 패치는 건너뛰고 움직임·잔차가 많은 패치만 선별해, 동일한 토큰 예산으로 훨씬 긴 시간 범위의 비디오를 처리합니다. 데이터셋·인코더 가중치·학습 코드·학습 로그까지 전 과정을 공개해 처음부터 끝까지 재현 가능한 것이 특징입니다. Apache 2.0 라이선스로 공개되어 있습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델