Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
PixelRAG는 웹 페이지, PDF, 이미지 문서를 텍스트로 파싱하는 대신 스크린샷 타일로 렌더링한 뒤 이미지 자체를 검색하는 시각 기반 RAG 파이프라인이다. UC 버클리 SkyLab, BAIR, Berkeley NLP 연구진의 동명 논문 공식 구현체로, HTML 파싱 과정에서 사라지는 표·차트·인포그래픽·레이아웃 정보를 보존해 리더 모델이 시각 정보를 직접 읽게 한다. 검색은 스크린샷 데이터로 LoRA 파인튜닝한 Qwen3-VL-Embedding이 담당하며, 위키피디아 828만 페이지 사전 구축 인덱스와 호스팅 API를 함께 제공한다. 문서 파싱 품질 탓에 RAG 정확도가 떨어지는 문제를 겪는 개발자에게 유용하다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델