Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
DeepSeek가 공개한 어텐션 커널 라이브러리로, DeepSeek-V4.1 모델의 추론을 NVIDIA GPU와 화웨이 Ascend NPU에서 구동한다. DeepSeek Sparse Attention(DSA)을 구현한 토큰 단위 스파스 커널을 prefill과 decoding 양쪽에 제공하며 KV 캐시를 FP8 또는 FP4로 쓴다. Q-norm·Q-RoPE·코어 어텐션·O-RoPE·FP8 캐스트를 하나로 합친 융합 커널은 작은 연산의 호출 오버헤드를 줄여 B200에서 prefill 1460 TFlops, decoding 950 TFlops를 기록했다. 2026년 9월 30일 릴리즈는 Ascend 950 커널을 추가한 대신 Hopper와 V3·V3.2·V4.0 지원을 제거해 이전 버전과 호환되지 않는다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진