Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
MOSS-VL은 OpenMOSS 팀이 공개한 11B 규모 오픈웨이트 비디오-언어 모델 시리즈로, 시각 인코딩과 언어 추론을 분리하는 크로스어텐션 구조를 기반으로 실시간 장편 비디오 이해에 특화되어 있습니다. 연속 스트리밍 영상을 보면서 언제든 질문에 답하고 스스로 발화 시점을 판단하는 MOSS-VL-Realtime, 오프라인 장편 비디오 이해·대화에 강한 MOSS-VL-Instruct, 사전학습 기반 모델인 MOSS-VL-Base 세 가지로 구성됩니다. 절대 타임스탬프 토큰과 XRoPE 위치 인코딩으로 프레임별 시점을 정밀하게 파악하며, SGLang·LlamaFactory 등 주요 추론·파인튜닝 프레임워크와 통합돼 있습니다. Apache 2.0 라이선스로 공개되어 있습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델