Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
PyTorch 팀이 개발한 PyTorch 네이티브 모델 최적화 라이브러리로, 학습부터 서빙까지 이어지는 양자화·희소화 워크플로를 하나의 API로 제공한다. quantize_() 한 줄로 int4 weight-only, float8 동적 양자화, int8 활성화+int4 가중치 등 다양한 저정밀 설정을 적용할 수 있으며, torch.compile·FSDP2와 그대로 호환되어 대부분의 Hugging Face PyTorch 모델에 바로 쓸 수 있다는 점이 핵심이다. 공식 README 기준 H100에서 Gemma3-12B를 int4로 양자화하면 1.73배 빨라지고 메모리를 65% 절감하며, float8 학습으로 Llama-3.1-70B 사전학습을 1.5배 가속했다고 보고한다. 양자화 인식 학습(QAT)으로 저비트 양자화의 정확도 손실을 회복할 수 있고, 8비트·4비트 옵티마이저와 CPU 오프로딩으로 학습 메모리도 줄여준다. Hugging Face Transformers·Diffusers, vLLM, SGLang, ExecuTorch, Unsloth, Axolotl, TorchTitan 등에 양자화 백엔드로 통합되어 서버 GPU부터 모바일 기기까지 동일한 최적화 모델을 배포할 수 있으며, BSD-3-Clause 라이선스로 공개되어 있다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구