Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
VisRAG는 문서를 텍스트로 파싱하지 않고 페이지 이미지 그대로 비전-언어 모델(VLM)로 임베딩해 검색하고 답변까지 생성하는 멀티모달 RAG 파이프라인입니다. OCR과 레이아웃 파싱 단계에서 흔히 발생하는 표·도표·서식 정보 손실을 없애 원본 문서의 정보를 최대한 보존하는 것이 핵심 아이디어입니다. 최신 버전인 EVisRAG(VisRAG 2.0)는 검색된 여러 이미지를 먼저 언어적으로 관찰해 이미지별 근거를 모은 뒤 그 단서로 추론하는 방식을 도입했고, 토큰 단위 보상을 적용한 Reward-Scoped GRPO로 시각 인지와 추론 능력을 함께 최적화합니다. 3B·7B 모델 가중치와 평가 벤치마크가 공개되어 도표가 많은 리포트·매뉴얼 검색 시스템에 적합합니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델
microsoft
작업, 언어, 모달리티 전반의 통일된 사전학습 모델