Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OmniJev 팀이 공개한 멀티모달 'System One' 판단 모델로, 스크린샷·사진·비디오·텍스트에 대한 타입이 지정된 질문(예/아니오, 선택지, 단계 점수)에 한 번의 순전파로 보정된 확률을 돌려준다. 0.8B·4B·9B·27B 네 가지 크기로, Qwen3.5-0.8B/4B/9B와 Qwen3.8-27B를 비전 타워를 고정한 채 1에폭 미세조정했다. README에 따르면 H200 한 장에서 1280×720 스크린샷 하나에 질문 10개를 물을 때 0.8B는 51ms, 27B는 324ms가 걸린다. PyTorch(텍스트·이미지·비디오)와 llama.cpp GGUF(텍스트·이미지) 백엔드로 같은 API를 서빙하며, 학습 데이터 9만4,707건(17.7GB)과 학습 설정도 공개했다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델