Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
studio-dots-ai가 공개한 멀티모달 OCR 모델로, 기존 dots.ocr의 후속작이다. 텍스트뿐 아니라 차트·다이어그램·UI 레이아웃·과학 도표 같은 그래픽 요소까지 일급 파싱 대상으로 취급해, 문서 안의 텍스트와 그래픽을 하나의 통합된 텍스트 표현으로 함께 파싱하는 것이 핵심 특징이다. 특히 구조화된 그래픽을 SVG 코드로 직접 변환하는 능력이 강점으로, 이미지-투-SVG 벤치마크에서 Gemini 3 Pro보다 높은 재구성 품질을 보였다고 소개됐다. 다국어 문서 파싱 성능도 함께 갖추고 있으며 MIT 라이선스로 공개된다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델