Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OCR과 레이아웃 인식 파이프라인 없이 문서 페이지를 이미지 그대로 검색하는 비전-언어 검색 모델 계열의 공식 학습·추론 코드입니다. PaliGemma-3B의 ViT 출력 패치를 선형 투영해 문서를 다중 벡터로 표현하고, ColBERT의 late interaction 방식으로 쿼리 임베딩과의 유사도를 최대화하도록 학습합니다. 덕분에 표·차트·도식처럼 텍스트 추출이 어려운 시각 요소까지 검색 대상에 포함되며, 깨지기 쉬운 문서 파싱 단계를 모델 하나로 대체합니다. 원본 ColPali 외에 ColQwen2, ColSmol 등 ColVision 계열과 바이인코더 변형을 함께 제공하고, ViDoRe 벤치마크로 성능을 검증합니다. colpali-engine 패키지로 설치해 바로 인덱싱·검색에 활용할 수 있습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델
microsoft
작업, 언어, 모달리티 전반의 통일된 사전학습 모델