Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Intel Neural Compressor는 PyTorch, TensorFlow, JAX 등 주요 딥러닝 프레임워크에서 정적·동적 양자화, SmoothQuant, 가중치 전용 양자화, 양자화 인식 학습, 혼합 정밀도 등 다양한 모델 압축 기법을 제공하는 오픈소스 파이썬 라이브러리다. LLaMA, Qwen, DeepSeek 같은 대형 언어모델의 고급 양자화를 AutoRound 통합으로 지원하며, Intel Gaudi·Core Ultra·Xeon 등은 물론 AMD·ARM CPU, NVIDIA GPU까지 폭넓은 하드웨어에서 동작을 검증했다. 최근 FP8 KV 캐시 정적 양자화와 NVFP4, MXFP8/MXFP4 등 최신 저정밀도 포맷 지원을 실험적으로 추가했다. Apache 2.0 라이선스로 공개된다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구