Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
사용자의 질문이 별도 텍스트 없이 오디오와 비디오 안에만 담겨 있는 '네이티브 시청각 대화' 과제를 위한 벤치마크·강화학습 보상 코드 저장소다. OmniVChat-Bench는 2,800개 대화(단일 턴 2,550, 멀티 턴 250)와 13,475개 계층형 루브릭 기준으로 대화 상태 인지, 멀티모달 개체 정렬, 모델 자기 인식, 환각 방지, 감정 인식 5개 능력을 17개 하위 분류로 평가한다. OmniVChat-RL은 같은 루브릭에 형식·효율·스타일 항을 더한 보상 레시피로 GSPO 트레이너 연동 어댑터를 포함한다. 약 28GB의 1080p 미디어는 Hugging Face 데이터셋으로 별도 배포되며, 채점에는 사용자가 지정한 LLM 저지 모델이 필요하다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델