Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Tencent WeChat Vision 팀이 공개한 범용 멀티모달 임베딩 모델군입니다. Qwen3.5를 기반으로 2B·4B·9B 세 크기로 배포되며, 대규모 멀티모달 정렬 단계를 거친 뒤 정교한 relevance supervision과 cross-scale knowledge transfer로 다듬는 2단계 학습으로 만들어졌습니다. 텍스트, 이미지, 비디오, 시각 문서, 그리고 이들이 섞인 interleaved 입력까지 하나의 임베딩 공간으로 정렬해, 검색·리트리벌·RAG 파이프라인에서 단일 인코더로 여러 모달리티를 함께 다룰 수 있습니다. `<embedding>` 토큰 위치에서 벡터를 뽑아 L2 정규화하며, Matryoshka 방식으로 64~4096차원까지 잘라 쓸 수 있습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델