Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
스위스 EPFL VILAB이 ICML 2026에 발표한 디코더 전용 any-to-any 멀티모달 생성 모델입니다. 하나의 causal transformer 안에 이산 시퀀스를 자기회귀로 예측하는 1D 전문가와 연속적인 공간 특징을 flow matching으로 다루는 2D 전문가를 함께 두어, 별도의 인코더·디코더나 모달리티별 가중치, 태스크별 파이프라인 없이 RGB 이미지·깊이·법선·분할맵·텍스트·검출 박스 등 16개 모달리티를 임의의 조합으로 상호 변환합니다. BAGEL-7B mixture-of-transformers 백본 위에 구축됐고, 학습에 쓴 15개 모달리티 데이터셋(MODUS-15Modality)도 Hugging Face로 함께 공개됐습니다. Apache-2.0 라이선스로 코드와 가중치, 데모가 모두 제공됩니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델