Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
싱가포르국립대 Show Lab이 공개한, 비전-언어 모델(VLM)이 로봇을 직접 '조작'하게 해주는 임바디드 하네스다. VLM은 이산적인 증분 행동 단위로 추론하고, 로봇별 인터프리터가 각 단위를 결정론적으로 실제 동작으로 변환한다. 같은 인터페이스로 클로즈드 소스 프런티어 VLM이 로봇 전용 학습 없이 제로샷으로 로봇을 제어하거나, 작은 오픈 모델을 H200 몇 GPU시간 미만으로 미세조정해 스텝당 행동 토큰 하나를 내는 정책으로 쓸 수 있다고 README는 설명한다. Franka, AgileX Piper(단일·양팔), ManiSkill, Isaac Lab, LIBERO가 하나의 어휘와 프롬프트를 공유하며, Qwen3.5 0.8B~9B·Gemma4 E4B용 LoRA 어댑터와 시연 데이터셋도 함께 공개됐다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델