Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
LLM 추론 전체를 단 하나의 GPU 커널(메가커널)로 컴파일하는 컴파일러 겸 런타임이다. 레이어별로 수백 개의 커널을 순차 실행하는 대신 필요한 연산과 GPU 간 통신을 한 번의 커널 실행 안에서 처리해, 프로젝트 측정치로 추론 지연을 1.2~6.7배 줄인다고 밝힌다. 사용자는 Python 수십 줄로 커널의 입출력과 계산 그래프를 정의하며, rmsnorm_linear_layer처럼 융합된 연산을 체이닝한 뒤 compile()을 호출하면 CUDA 메가커널이 생성된다. 워커·스케줄러 수를 물리 SM 수에 맞춰 지정하고 NVSHMEM 텐서로 멀티 GPU all-reduce까지 커널 안에서 수행한다. OSDI 2025·2026 논문으로 발표됐고 Apache-2.0 라이선스다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진