Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Kubernetes 위에서 생성형 AI와 예측형 AI 모델 추론을 하나의 표준화된 플랫폼으로 통합하는 분산 모델 서빙 프레임워크로, CNCF 인큐베이팅 프로젝트이자 Kubeflow의 핵심 애드온 컴포넌트다. InferenceService라는 Kubernetes 커스텀 리소스(CRD)로 모델 배포를 선언적으로 관리하며, TensorFlow·PyTorch·scikit-learn·XGBoost·ONNX 등 다양한 프레임워크의 모델을 동일한 방식으로 서빙한다. LLM 서빙에서는 vLLM과 llm-d를 최적화 백엔드로 활용하고 OpenAI 호환 추론 프로토콜, 모델 캐싱, CPU·디스크로의 KV 캐시 오프로딩, 생성형 워크로드에 맞춘 요청 기반 오토스케일링을 제공한다. Knative 기반 서버리스 배포 시 사용하지 않는 고가 자원을 0까지 축소(scale-to-zero)해 비용을 줄일 수 있고, 카나리 롤아웃, InferenceGraph를 통한 추론 파이프라인·앙상블, 모델 설명 가능성, 페이로드 로깅·드리프트 탐지 등 엔터프라이즈 운영 기능도 갖췄다. 고밀도 멀티 모델 서빙을 위한 ModelMesh 설치 옵션도 제공하며, Apache-2.0 라이선스로 공개되어 있다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구