Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Meta가 2026년 8월 10일 Apache-2.0으로 공개한 300억 파라미터 로컬 에이전틱 멀티모달 모델입니다. 대형 모델 Muse Spark에서 증류해 만들었고, 이미지·비디오를 처리하는 20억 파라미터 Perception Encoder와 슬라이딩 윈도우·풀 어텐션을 번갈아 쓰는 280억 파라미터 텍스트 디코더로 구성됩니다. 텍스트 전용 대화는 물론 이미지·비디오가 섞인 멀티모달 입력, 도구 호출과 구조화된 출력, 이미지 내 객체 검출, 코딩·문서 분석 같은 에이전트 워크플로를 소비자용 GPU 한 장에서 돌릴 수 있도록 설계됐습니다. BF16 가중치와 GGUF 양자화본, ExecuTorch 빌드, 추론 가속용 DFlash 드래프터가 공개 첫날부터 함께 제공됐습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델