Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
스탠퍼드 Hazy Research 연구실이 관리하는 CUDA 기반 딥러닝 커널 작성 프레임워크다. 16x16 이상의 타일을 기본 단위로 다루는 프리미티브를 제공하며, CUDA에 그대로 내장돼 필요하면 저수준 코드를 섞어 쓸 수 있다. 텐서 코어(WGMMA, TCGEN05), TMA 비동기 로드, 연산·I/O 오버랩 템플릿, NVLink 멀티 GPU 전송을 간결하게 활용한다. 2026년 1월 2.0에서 Blackwell과 MXFP8·NVFP4를 지원했고 9월에는 Vera Rubin GPU용 GEMM 커널을 추가했다. README에 따르면 Together AI, Cursor 등이 사용 중이다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진