Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
TurboVLA는 화중과기대(HUST)와 화웨이 연구진이 공개한 경량 비전-언어-행동(VLA) 모델의 공식 구현이다. 시각 관측과 언어 지시를 대형 언어 모델에 통과시키는 기존 V→L→A 구조 대신, 두 입력을 각각 인코딩한 뒤 가벼운 양방향 비전-언어 상호작용으로 정보를 교환하고 컴팩트 디코더로 연속 행동 청크를 예측하는 V+L→A 구조를 택했다. README 기준 0.2B 모델이 LIBERO에서 평균 성공률 97.6%, RTX 4090에서 추론 지연 31.2ms·VRAM 0.9GiB를 기록했고, 0.4B 모델은 RoboTwin 2.0에서 88.06%를 보고했다. 학습·평가 코드와 체크포인트가 공개돼 있다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델