Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
FastDeploy는 PaddlePaddle 기반의 LLM·VLM 추론 배포 툴킷이다. vLLM 인터페이스와 호환되는 OpenAI API 서버를 단일 명령으로 띄울 수 있고, 프리필과 디코드를 분리하는 PD 분리 배포를 부하 분산과 인스턴스 역할 동적 전환까지 포함해 제공한다. KV 캐시 전송은 NVLink와 RDMA를 상황에 따라 선택하는 통합 전송 라이브러리가 담당한다. W8A16, W8A8, W4A16, W4A8, W2A16, FP8 등 양자화 포맷과 투기적 디코딩, 다중 토큰 예측(MTP), 청크 프리필, 프리픽스 캐싱을 지원한다. NVIDIA GPU 외에 쿤룬신 XPU, 하이곤 DCU, 인텔 가우디 등 여러 가속기에서 동작한다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구