Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
음성 대화, 연속적인 멀티모달 인지, 장기 작업 실행을 하나의 실시간 상호작용으로 묶은 오픈소스 네이티브 전이중(full-duplex) 상호작용 에이전트다. MiniCPM-o 4.5를 기반으로 한 스트리밍 'Cerebellum'이 1초 단위로 음성·비디오를 받아 듣기·말하기·끼어들기·도구 호출 중 무엇을 할지 먼저 예측하고, 복잡한 요청은 비동기 'Brain'(기본 제공 공급자는 Codex)에 위임한다. 사용자는 작업이 진행되는 동안에도 말을 걸어 요구사항을 바꾸거나 화면을 보여주고 권한을 승인할 수 있다. README 기준 WorldSense 49.62%, Daily-Omni 78.53% 정확도를 보고하며, 기본 서빙 구성은 GPU 3장(Thinker·Talker·ASR)을 요구한다.
OpenBMB
휴대폰에서도 돌아가는 초경량 이미지·비디오 이해 멀티모달 LLM
haotian-liu
GPT-4V 수준의 시각적 지시 조정 멀티모달 AI 모델
baidu
Baidu가 공개한 DeepSeek-OCR 계승 문서 파싱 VLM

OpenBMB
스마트폰에서 실행 가능한 멀티모달 AI 모델