Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
1,250억 파라미터 MoE 모델 Qwen3.8-Flash-Next를 12GB VRAM 이상의 일반 게이밍 PC(NVIDIA·AMD, Windows·Linux)에서 실행하게 해주는 로컬 추론 엔진이다. 2만4천여 개 전문가 중 자주 쓰이는 것은 GPU에, 전체는 RAM에 두고 CPU가 나머지를 병렬 처리하며, 작은 보조 모델이 다음 토큰을 추측하고 본 모델이 검증하는 추측 디코딩으로 1.6~1.8배 빠르게 응답한다. RTX 5070 기준 초당 53~94토큰을 기록했다. 설치 스크립트가 하드웨어에 맞는 양자화 크기를 골라 내려받고, localhost에 OpenAI·Anthropic 호환 API를 띄워 Claude Code·Codex 같은 코딩 에이전트와 바로 연결된다.
huggingface
SOTA 기계학습 모델을 위한 오픈소스 모델 정의 프레임워크
google-gemini
터미널에서 Gemini AI를 사용하는 Google 공식 CLI 에이전트
rasbt
PyTorch로 ChatGPT 스타일 LLM을 처음부터 구현하는 교육용 자료
punkpeye
LLM 도구 연동 표준 MCP 서버 큐레이션 모음