Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
llama-swap은 로컬에 설치한 여러 추론 서버 앞단에 놓이는 프록시로, 들어온 요청의 모델 ID를 보고 해당 모델을 자동으로 띄우고 이전 모델은 내려 GPU 메모리를 회수한다. llama.cpp, vLLM, tabbyAPI, stable-diffusion.cpp 등 OpenAI·Anthropic API 호환 서버라면 종류를 가리지 않고 연결할 수 있어, 엔진을 교체하거나 업그레이드해도 클라이언트 설정은 그대로 둘 수 있다. Go로 작성되어 외부 의존성 없이 바이너리 하나와 YAML 설정 파일 하나로 동작하며, 채팅·임베딩·리랭크·음성·이미지 생성 엔드포인트를 함께 프록시한다. ttl 설정으로 유휴 모델을 자동 언로드하고, 웹 UI와 Prometheus 메트릭, 실시간 로그 스트리밍도 제공한다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구