Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Triton Inference Server는 NVIDIA가 개발한 오픈소스 추론 서빙 플랫폼으로, TensorRT, PyTorch, TensorFlow, ONNX, OpenVINO 등 사실상 모든 프레임워크로 학습된 모델을 하나의 서버에서 통합 서빙할 수 있습니다. 동적 배칭, 모델 앙상블, 다중 모델 동시 실행, GPU/CPU 자동 스케줄링을 지원해 대규모 프로덕션 환경에서 처리량과 지연시간을 동시에 최적화합니다. HTTP/gRPC API와 C API를 모두 제공하며 Kubernetes 환경에 최적화된 배포 구조를 갖추고 있어 클라우드부터 엣지 디바이스까지 폭넓게 사용됩니다. NVIDIA의 Triton Management Service, Model Analyzer 등과 결합해 추론 인프라 운영을 자동화할 수 있는 것도 강점입니다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구