Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
SenseTime의 파운데이션 모델 조직 SenseNova가 공개한 비전 모델로, 컴퓨터 비전을 통합 멀티모달 생성(UMM) 문제로 재정의해 객체 검출·OCR·키포인트·분할·깊이·표면 법선·다시점 포인트맵·카메라 포즈 추정을 하나의 모델에서 처리한다. 과제는 자연어 지시와 선택적 시각 프롬프트로 지정하며, 박스·좌표·OCR 문자열 같은 기호형 결과는 텍스트로, 마스크·깊이맵 같은 밀집 결과는 이미지로 생성한다. 과제별 예측 헤드나 디코더 없이 SenseNova-Vision-Corpus-50M으로 학습했고, 7B MoT 가중치와 데이터셋, 추론·평가·학습 코드가 함께 공개됐다. 코드는 Apache-2.0, 모델 가중치는 CC BY-NC 4.0이다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델