Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
HyperQwen은 대형 Qwen 모델을 소비자용 GPU에서 서빙하는 프로젝트로, 고정된 vLLM 버전에 대한 패치 시리즈와 모델 준비 파이프라인으로 구성된다. Qwen3.8-27B를 24GB GPU 한 장에서 최대 150k 토큰 컨텍스트와 API 키 인증이 있는 OpenAI 호환 API로 제공한다. 프로젝트 측 측정에 따르면 250W로 제한한 RTX 3090에서 단일 사용자 모드 127 tok/s, 배치 모드 64 동시 요청 시 약 1,035 tok/s 집계 디코딩 속도를 기록했다. 헤드 재양자화, 보정된 드래프트 어휘, 프롬프트에서 드래프트를 뽑는 speculative decoding 등을 적용하며, Docker Compose로 single·batch 모드를 전환한다. Apache 2.0 라이선스다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진