Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
vLLM-Omni는 텍스트 자기회귀 생성에 최적화되어 있던 vLLM을 옴니모달리티 모델 추론·서빙으로 확장한 프레임워크로, vLLM 커뮤니티가 2025년 11월 공식 공개했다. 텍스트·이미지·오디오·비디오·액션 데이터를 하나의 파이프라인에서 처리하고, Diffusion Transformer 같은 비자기회귀 병렬 생성 구조까지 지원한다. OmniConnector 기반 완전 분리 서빙과 단계별 파이프라인 실행 오버랩으로 처리량을 높였다. Qwen3-Omni, MiniCPM-o 4.5부터 TTS·확산 모델, 로봇 정책 모델까지 커버하며 OpenAI 호환 API 서버를 제공한다. 멀티모달 모델을 실제 서비스로 배포하는 인프라 개발자에게 적합하다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델