Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
사전학습된 비전-언어 모델(VLM)을 기반으로 텍스트나 이미지 입력을 받아 SVG(벡터 그래픽)를 직접 생성하는 최초의 통합 멀티모달 SVG 생성 모델이다. NeurIPS 2025에 채택된 연구로, 단순한 아이콘부터 정교한 애니메 캐릭터 일러스트까지 복잡도가 다른 다양한 벡터 이미지를 하나의 모델로 생성해낸다. 이를 뒷받침하기 위해 200만 개의 정밀 주석이 달린 SVG 자산으로 구성된 대규모 멀티모달 데이터셋 MMSVG-2M과 표준화된 평가 프로토콜 MMSVGBench를 함께 공개했다. 3B·4B·8B 등 여러 규모의 모델 가중치와 학습 코드, Hugging Face 데모까지 모두 오픈소스로 제공되며, Apache 2.0 라이선스로 배포되어 로고·아이콘 디자인, 애니메이션 캐릭터 제작 등 실무 활용이 가능하다. 최근에는 Lottie 애니메이션 생성 모델 OmniLottie로도 프로젝트가 확장되고 있다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델