Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Rapid-MLX는 애플 실리콘 맥에서 로컬 LLM을 서빙하기 위한 추론 엔진으로, llama.cpp 폴백이나 Metal 셰이더 계층을 거치지 않고 MLX 커널만으로 동작합니다. 연속 배칭, 래딕스 트리 기반 프롬프트 캐시, int4/int8 및 TurboQuant K8V4 코덱을 적용한 KV 캐시 양자화를 갖췄고, 저장소가 공개한 자체 벤치마크에서 Ollama 대비 최대 3배 처리량을 기록했다고 밝히고 있습니다. OpenAI와 Anthropic API를 모두 같은 포트에서 제공하기 때문에 Claude Code, Codex CLI, Aider 같은 에이전트 CLI를 명령 한 줄로 로컬 엔드포인트에 연결할 수 있습니다. 음성·비전·영상 모델은 옵션 패키지로 분리돼 있습니다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구