Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
10Gb/s USB-C 케이블로 iPhone을 MacBook에 연결해 Qwen3.8-27B 로컬 추론을 분담하게 하는 오픈소스 프로젝트다. 엔진은 SME2·Metal 퓨전·DFlash2 추측 디코딩을 더한 llama.cpp 포크다. prefill 시 Mac이 1~40층, iPhone GPU가 41~64층을 파이프라인으로 실행하고, 64k를 넘는 오래된 KV 페이지는 iPhone이 보관하며 GPU·Neural Engine으로 해당 구간 어텐션을 계산한다. README 측정 기준 16k~48k 컨텍스트에서 prefill이 29~44% 빨라졌고, 24GB Mac 단독보다 긴 컨텍스트를 수용한다. greedy 출력은 iPhone 사용 여부와 관계없이 동일하며 OpenAI 호환 서버를 제공한다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진