Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
상하이 AI 연구소(InternLM)가 공개한 통합 멀티모달 모델의 추론 코드 저장소다. 텍스트 질의응답, 텍스트-이미지 생성, 이미지 이해, 지시 기반 이미지 편집, 비디오 이해, 3D 이해를 하나의 모델과 하나의 이산 토큰 인터페이스로 처리한다. 백본은 LLaDA-2.0 MoE 확산 언어 모델(총 16B, 활성 1B)이며, Apple AToken 기반 8개 코드북으로 각 시각 위치를 표현해 시퀀스 길이를 늘리지 않고 텍스처·글자·기하 정보를 보존한다. 출력은 공간 위치를 병렬로 디노이징하고 코드북 순서로 자기회귀 예측하는 구조다. NVIDIA GPU와 Ascend NPU를 모두 지원하며, 현재 Ascend 학습 가중치만 공개되었고 NVIDIA 가중치·학습 코드·기술 보고서는 추후 공개 예정이다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델