Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Alibaba Qwen 팀이 공개한 멀티모달 플러그인 모음으로, 에이전트 하네스가 이미지·비디오·오디오·문서를 직접 다룰 수 있게 해 준다. 각 기능은 Skill과 선택적 MCP 서버 한 쌍으로 독립 설치되며, 설치 스크립트 하나로 Claude Code·Codex·Qwen Code·Gemini CLI 등 7개 하네스에 연결된다. core 플러그인은 API 키 없이 로컬 이미지와 비디오 프레임을 메인 모델이 네이티브로 읽게 하고, api 플러그인은 DashScope 또는 호환 셀프호스팅 서비스를 통해 Qwen VL·Omni 모델의 OCR, 그라운딩, 전사·화자 분리, SAM3 분할을 호출한다. 긴 영상 메모리, 영상 편집, Blender·FreeCAD 제어 기능도 포함하며 Apache-2.0 라이선스다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델