Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
칭화대학교 PACMAN 그룹(thu-pacman)이 공개한 프로덕션급 대규모 언어 모델 추론 프레임워크로, 중국 역사 속 명마 '적토마(赤兔)'에서 이름을 따 효율성·유연성·가용성을 핵심 목표로 내세운다. NVIDIA 최신 플래그십부터 구형 GPU까지 지원하는 동시에 화웨이 Ascend 910B, MetaX, Hygon, Moore Threads 등 NVIDIA 외 AI 가속기에도 최적화를 제공하는 것이 가장 큰 차별점이다. 순수 CPU, 단일 GPU, MoE 레이어를 CPU에 올리는 CPU+GPU 이기종 하이브리드 추론부터 멀티 노드 클러스터까지 확장할 수 있으며, TP·PP·DP·전문가 병렬(EP)·Prefill 컨텍스트 병렬과 Prefill/Decode 분리(PD disaggregation)를 지원한다. DeepSeek-V3/V4, GLM-5 시리즈, Qwen, Kimi 등 대형 MoE 모델을 FP8·FP4·W8A8 등 양자화 포맷으로 서빙하고 OpenAI 호환 API를 제공한다. 2026년 7월 v0.6.0에서는 단일 실행 파일 chitu.run으로 멀티 노드·멀티 인스턴스·PD 분리 배포를 간소화했으며, Apache-2.0 라이선스로 공개되어 있다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구