Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
OmniGen2는 하나의 모델로 시각 이해, 텍스트-이미지 생성, 지시 기반 이미지 편집, 인컨텍스트 생성까지 처리하는 통합 멀티모달 생성 모델입니다. 1세대와 달리 텍스트와 이미지 경로를 분리해 파라미터를 공유하지 않는 이중 디코딩 구조와 독립된 이미지 토크나이저를 사용하며, Qwen2.5-VL 기반의 시각 이해 능력을 그대로 이어받았습니다. 인물·참조 사물·장면 등 여러 입력을 자유롭게 조합해 새로운 이미지를 만드는 인컨텍스트 생성이 강점이며, 이를 측정하기 위한 OmniContext 벤치마크와 학습 데이터셋 X2I2도 함께 공개했습니다. ComfyUI 공식 지원과 CPU 오프로드를 제공해 VRAM이 제한된 환경에서도 실행할 수 있습니다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델
microsoft
작업, 언어, 모달리티 전반의 통일된 사전학습 모델