Open Source
GitHub, HuggingFace의 최신 AI 오픈소스 프로젝트를 탐색하세요.
Ray와 vLLM 분산 아키텍처를 결합한 프로덕션급 오픈소스 RLHF(인간 피드백 기반 강화학습) 프레임워크로, 최초로 통합된 에이전트 기반 실행 파이프라인을 도입해 표준 PPO 학습부터 복잡한 멀티턴 추론까지 하나의 토큰 인·아웃 구조로 처리한다. Ray가 Actor·Reward·Reference·Critic 모델을 GPU 전반에 분산 스케줄링하고, 샘플 생성 단계(RLHF 학습 시간의 80%를 차지)를 vLLM이 고속 처리하며, DeepSpeed ZeRO-3와 RingAttention으로 70B 이상 대형 모델 학습을 메모리 효율적으로 지원한다. PPO, REINFORCE++, GRPO, RLOO 등 최신 RL 알고리즘과 비동기 RLHF, VLM(비전-언어 모델) 멀티턴 RL을 지원하며, CMU 대학원 강의의 RLHF 교육 사례로 채택되고 DeepSeek-R1·Logic-RL 등 다수 재현 연구에 활용됐다. Apache-2.0 라이선스로 공개되어 있다.
huggingface
SOTA 기계학습 모델을 위한 오픈소스 모델 정의 프레임워크
google-gemini
터미널에서 Gemini AI를 사용하는 Google 공식 CLI 에이전트
rasbt
PyTorch로 ChatGPT 스타일 LLM을 처음부터 구현하는 교육용 자료
punkpeye
LLM 도구 연동 표준 MCP 서버 큐레이션 모음