Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
inco.ai가 공개한 Apple 실리콘 전용 로컬 LLM 추론 엔진으로, 코딩 에이전트와 OpenAI·Anthropic 호환 앱을 Mac 한 대에서 구동하는 것을 목표로 한다. DFlash 2 추측 디코딩, 모델 형태에 맞춘 전용 Metal 커널, 자동 메모리 계획을 결합하고 프리픽스 캐시 재사용과 동시 요청 자동 배칭을 지원한다. Qwen3.8-27B와 Qwen3.6-35B-A3B의 GGUF·MLX 가중치를 불러오며 맞는 DFlash2 드래프트를 자동 선택한다. README 벤치마크 기준 동일 GGUF 가중치에서 llama.cpp 대비 35B는 2.5~3.2배, 27B는 4.5~5.3배 디코드 속도를 보였다. M3 이상, macOS 26.4 이상이 필요하다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진