Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
TurboQuant는 ICLR 2026 논문(arXiv:2504.19874)의 KV 캐시 압축 기법을 vLLM에 붙여 구현한 저장소입니다. 랜덤 직교 회전으로 정보를 차원 전체에 분산시킨 뒤 베타 분포에 맞춘 Lloyd-Max 최적 스칼라 양자화를 적용하고, QJL 투영으로 잔차 부호 비트를 더해 키를 3비트, 값을 2비트까지 줄입니다. 결합 추정기가 편향되지 않아 압축 후에도 내적 기댓값이 원본과 일치한다는 점이 이 방식의 근거입니다. RTX 5090 단일 GPU와 RTX 3090 8장 구성에서 덴스와 MoE 모델 양쪽을 측정한 수치를 공개했고, 순수 덴스 트랜스포머 기준 압축률은 약 4.4배입니다. 최근 GitHub 트렌딩 상위에 오른 벡터 인덱스 turbovec이 이 구현을 기반으로 만들어졌습니다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구