Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
데이터센터 GPU가 아니라 RTX 3090 같은 소비자 카드에서 로컬 LLM을 얼마나 빠르게 돌릴 수 있는지에 집중한 C++ 추론 서버입니다. 초안 모델로 디코딩을 앞당기는 DFlash, 프리필 단계까지 투기 실행하는 PFlash, 여러 커널을 하나로 합쳐 런치 오버헤드를 없애는 메가커널, KV 캐시를 고정 크기 GPU 풀로 페이징해 컨텍스트가 길어져도 디코딩 속도가 떨어지지 않게 하는 KVFlash, MoE 전문가를 핫/콜드로 나눠 VRAM 밖으로 내리는 Spark까지 최적화가 모듈별로 분리되어 있습니다. 각 최적화는 특정 모델 계열과 하드웨어를 겨냥해 튜닝되며, llama.cpp 대비 벤치마크와 CUDA·ROCm 도커 이미지, OpenAI 호환 API를 제공합니다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구