Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
744B~2.8T 파라미터급 초대형 MoE 모델을 이미 가진 소비자·이기종 하드웨어에서 돌리기 위한 순수 C 추론 엔진이다. 어텐션·공유 전문가·임베딩 같은 밀집 부분은 int4로 RAM에 상주시키고, 토큰마다 바뀌는 라우팅 전문가(expert)만 디스크에서 필요할 때 스트리밍해 VRAM·RAM·NVMe를 하나의 배치 계층으로 다룬다. GLM-5.2/5.3, Kimi K3, DeepSeek V4 Flash, Qwen3.6 등 9개 모델 계열을 계열별 C 파일 하나로 지원한다. 빠른 메모리가 부족하면 속도만 느려질 뿐 모델 정밀도나 라우터 동작은 바꾸지 않는다는 원칙을 두며, 속도 SLA가 없는 연구 플랫폼이라고 스스로 밝힌다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구