Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
gLLM은 분산 환경에서 LLM을 서빙하기 위한 추론 엔진으로, 일반 dense 모델뿐 아니라 MoE, 멀티모달, 하이브리드 어텐션 구조까지 폭넓게 지원한다. continuous batching, paged attention, chunked prefill, prefix caching, CUDA graph 등 최신 서빙 최적화 기법을 적용했고, 파이프라인·텐서·전문가(expert) 병렬화를 조합해 대규모 모델을 여러 GPU에 분산 배치할 수 있다. FP8·INT4 양자화를 지원해 메모리 사용량을 줄이면서 오프라인 배치 추론, 온라인 서빙, 대화형 챗 인터페이스를 모두 제공한다. Qwen, DeepSeek, Llama, Kimi 계열 모델과 호환되며 최근 Qwen3.8, DeepSeek V3.2 sparse attention 지원을 추가했다. SC'25와 NeurIPS'25에 논문이 채택된 연구 배경을 가진 프로젝트다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구