Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
앤트그룹(Ant Group) 산하 InclusionAI가 공개한 옴니모달 언어 모델로, 자체 개발한 Ling-2.0 MoE 아키텍처를 기반으로 100B 총 파라미터 중 6B만 활성화하는 구조를 채택했다. 이미지·텍스트·영상·오디오 네 가지 모달리티를 입력으로 받아 이해할 수 있고, 텍스트·자연스러운 실시간 음성·이미지를 함께 생성할 수 있어 별도의 태스크별 파인튜닝이나 구조 변경 없이 하나의 모델로 다양한 작업을 처리한다. 오디오 디코더와 이미지 생성 모듈 Ming-Lite-Uni를 통합해 GPT-4o 수준의 모달리티 지원 범위를 오픈소스로 구현한 것이 특징이며, 코드와 가중치가 모두 MIT 라이선스로 공개돼 있다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델