Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
mllm은 모바일·엣지 기기에서 구동하도록 설계된 경량 멀티모달 LLM 추론 엔진이다. C++로 작성되어 있으며 Arm CPU, OpenCL GPU, QNN NPU, Ascend NPU 등 서로 다른 하드웨어를 하나의 API로 다루는 통합 백엔드를 제공한다. 양자화, 프루닝, 추측 실행(speculative execution) 같은 최적화 기법을 적용했고 NPU 프레임워크 연동을 위한 NPU-ready IR과 SDK·CLI 형태의 배포 툴킷을 함께 제공한다. 최근에는 Jetson Orin에서 CUDA 런타임을 지원해 AGX Orin 32GB 기준 prefill 속도를 최대 3.12배 높였고, 인앱 Golang 서버를 활용한 안드로이드 클라이언트-서버 구조와 스트리밍 추론 데모도 추가됐다. Qwen, LLaMA, Mistral과 Qwen2-VL 같은 멀티모달 모델을 포함해 40종 이상의 모델을 지원한다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구