Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
개인용 PC와 소비자 GPU에서 프런티어급 오픈 웨이트 MoE 모델을 서빙하기 위한 엣지 네이티브 추론 엔진이다. GPU·CPU·호스트 메모리·인터커넥트를 하나의 탄력적 추론 자원으로 묶어, 전문가(expert)를 호스트 RAM에 두고 GPU에는 LRU 캐시만 올리거나 캐시 미스를 PCIe 전송과 CPU 연산으로 나눠 겹쳐 처리한다. DeepSeek-V4-Flash, GLM-5.2, Qwen3.6, gpt-oss 등 HF safetensors 체크포인트를 직접 로드하고 OpenAI·Anthropic 호환 API를 제공한다. Ion Stoica, Matei Zaharia, Song Han 등이 저자로 참여한 arXiv 논문(2608.16157)이 함께 공개됐다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진