Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
kvpress는 NVIDIA가 공개한 LLM KV 캐시 압축 라이브러리다. 긴 컨텍스트에서 KV 캐시가 토큰 수에 비례해 커지는 문제를 겨냥했으며, Llama 3.1-70B로 100만 토큰을 처리하면 float16 기준 330GB가 필요하다는 점을 출발점으로 삼는다. 압축 로직을 'press'라는 단위로 추상화해 SnapKV, StreamingLLM, PyramidKV, ThinK, KVzip 등 30종 이상의 논문 기법을 같은 인터페이스로 구현했고, compression_ratio 값 하나로 압축 강도를 조절한다. HuggingFace transformers 파이프라인으로 등록되어 기존 코드에 몇 줄만 추가하면 적용된다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구