Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
대규모 비전-언어 모델(LVLM)을 한 줄 명령으로 평가하는 오픈소스 툴킷입니다. 220개 이상의 멀티모달 모델과 80개 이상의 벤치마크를 지원해, 벤치마크마다 다른 저장소를 오가며 데이터를 준비하던 부담을 없앴습니다. 생성 기반 평가를 일괄 적용하고 정확 일치와 LLM 기반 답변 추출 결과를 함께 제공해 객관식·서술형 과제 모두에서 일관된 비교가 가능합니다. GPT-4V, Claude, Gemini 같은 API 모델과 InternVL, LLaVA, Qwen-VL 등 오픈 가중치 모델을 동일한 인터페이스로 다루며, thinking 모드 모델의 사고 과정 분리(SPLIT_THINK)와 32k를 넘는 장문 응답을 위한 TSV 저장 옵션도 추가됐습니다. 평가 결과는 OpenCompass 리더보드로 이어집니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델
microsoft
작업, 언어, 모달리티 전반의 통일된 사전학습 모델