Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Qwen3.5 계열 Dense·MoE 아키텍처를 NVIDIA GeForce RTX 5090 한 장에서 최대 성능으로 돌리기 위해 처음부터 작성한 C++/CUDA 추론 엔진이다. GPU 하나, 상주 모델 하나, 시작 시 고정되는 1~8개 동시 요청이라는 좁은 범위로 의도적으로 특화했다. Qwen3.6-27B, Qwen3.8-27B, Qwen3.6-35B-A3B용 공식 .ninfer 아티팩트 5종을 Hugging Face에 배포하며, 텍스트·이미지·비디오 프롬프트를 로컬 CLI 또는 OpenAI·Anthropic 호환 HTTP API로 처리한다. 개발자 개인이 관심으로 진행하는 프로젝트라고 README에 밝히고 있다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
JustVugg
초대형 MoE 모델의 전문가를 디스크에서 스트리밍해 개인 하드웨어에서 돌리는 순수 C 추론 엔진