Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
MiniMind-O는 텍스트·음성·이미지를 입력받아 텍스트와 스트리밍 음성으로 답하는 약 0.1B 규모의 엔드투엔드 Omni 모델을 처음부터 구현한 오픈소스 프로젝트다. MiniMind 시리즈의 세 번째 작업으로, Thinker가 멀티모달 입력을 이해하고 독립된 Talker가 MTP 방식으로 8층 Mimi 코드를 동시에 예측해 24kHz 음성을 생성한다. 음성·이미지 특징은 고정된 SenseVoice-Small과 SigLIP2로 추출한 뒤 2층 MLP 프로젝터로 주입한다. 핵심 모듈은 PyTorch 네이티브로 작성됐고, 코드·가중치·학습 데이터·기술 보고서를 모두 공개하며 mini 데이터셋은 RTX 3090 한 장에서 약 2시간이면 학습 파이프라인을 끝까지 돌릴 수 있다고 README는 밝힌다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델