Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
PyTorch 모델의 k-bit 양자화를 통해 대형 언어모델을 더 적은 메모리로 추론·학습할 수 있게 해주는 라이브러리다. 핵심 기능은 세 가지로, 블록 단위 양자화로 32비트 수준 성능을 유지하면서 메모리를 크게 줄이는 8비트 옵티마이저, 벡터 단위 양자화로 대부분의 피처를 8비트로 처리하고 이상치만 16비트로 별도 연산해 성능 저하 없이 메모리를 절반으로 줄이는 LLM.int8() 8비트 양자화 추론, 모델을 4비트로 양자화한 뒤 소수의 학습 가능한 LoRA 가중치를 삽입해 성능 손실 없이 파인튜닝을 가능케 하는 QLoRA 4비트 양자화가 있다. `Linear8bitLt`, `Linear4bit` 같은 양자화 연산 프리미티브와 `bitsandbytes.optim` 8비트 옵티마이저 모듈을 제공하며 Hugging Face Transformers, PEFT 등과 긴밀히 통합되어 있다. Python 3.10 이상과 PyTorch 2.4 이상 환경에서 NVIDIA·AMD GPU 및 CPU를 지원하며, MIT 라이선스로 공개되어 있다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구