Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Text Generation Inference(TGI)는 Hugging Face가 개발한 대규모 언어 모델 전용 추론 서버로, Llama, Mistral, Qwen, DeepSeek 등 주요 오픈소스 LLM을 프로덕션 환경에서 빠르고 안정적으로 서빙하기 위해 설계됐습니다. 연속 배칭(continuous batching), Flash Attention, Paged Attention, 텐서 병렬화, 양자화(GPTQ/AWQ/bitsandbytes) 등 최신 최적화 기법을 기본 내장해 처리량을 극대화합니다. OpenAI 호환 메시지 API와 스트리밍 응답을 지원하며, Hugging Face Hub의 수십만 개 모델과 즉시 연동되어 별도 변환 없이 배포할 수 있는 것이 큰 장점입니다. Rust로 작성된 라우팅 계층 덕분에 낮은 오버헤드와 높은 동시성을 동시에 확보했습니다.

ollama
로컬 LLM을 쉽게 실행하는 도구

ggml-org
C/C++로 작성된 로컬 LLM 추론 엔진

exo-explore
일상 기기를 AI 클러스터로 연결하는 분산 추론 플랫폼
mozilla-ai
단일 파일 하나로 LLM을 설치 없이 즉시 실행하는 배포 도구