Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
NVIDIA와 워털루대가 공개한, VAE와 비전 인코더 없이 하나의 디코더 전용 트랜스포머로 원시 픽셀을 직접 읽고 쓰는 통합 멀티모달 모델이다. 이미지는 16×16 패치, 비디오는 4프레임 튜브로 나눠 넣고, Qwen3-8B 백본 위에 이해·생성 전문가를 따로 두되 텍스트·깨끗한 픽셀·노이즈 픽셀이 하나의 셀프 어텐션을 공유한다. 기본 체크포인트(S8-F22-R05) 하나로 텍스트→이미지, 텍스트→비디오(96프레임·24FPS 예시), 이미지 이해, 비디오 이해 4가지 작업을 수행한다. 저장소에는 추론 코드와 4단계 토이 학습 예제가 들어 있으며, 토이 학습에는 48GiB 이상 GPU 7장과 약 61GB 출력 공간이 필요하다고 README는 밝힌다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델