DeepSeek DSec 논문 분석: 초당 5000개 샌드박스 처리 에이전트 훈련 인프라
DeepSeek가 량원펑 등 130명 공동저자 명의로 에이전트 RL 훈련용 샌드박스 인프라 'DSec' 논문을 공개했다. 하루 300만 개 샌드박스를 처리하며 리워드 해킹 완화 설계도 담았다.
DeepSeek가 량원펑 등 130명 공동저자 명의로 에이전트 RL 훈련용 샌드박스 인프라 'DSec' 논문을 공개했다. 하루 300만 개 샌드박스를 처리하며 리워드 해킹 완화 설계도 담았다.
핵심 요약
DeepSeek가 2026년 9월 23일, 창업자 량원펑(Liang Wenfeng)을 포함한 약 130명의 공동저자 명의로 논문 'DeepSeek Elastic Compute(DSec)'을 arXiv에 공개했다. DSec은 대규모 에이전트 강화학습(RL) 훈련과 평가를 위한 샌드박스 인프라 플랫폼이다. 에이전트 RL 훈련이란 AI 모델이 가상의 환경 속에서 행동하고, 그 결과에 따라 보상을 받으며 스스로 개선해 나가는 학습 방식을 말한다. 이 과정에서 에이전트가 실제로 작업을 시도해볼 '연습 공간'이 대량으로 필요한데, DSec은 이 공간을 크고 안전하고 빠르게 만들어주는 인프라다.
주요 기능
1. 샌드박스란 무엇인가
샌드박스는 프로그램이나 에이전트가 실제 시스템에 영향을 주지 않도록 격리된 가상의 실행 공간이다. 에이전트가 코드를 실행하거나 파일을 조작하는 훈련을 반복할 때마다 안전한 새 환경이 필요한데, DSec은 이런 샌드박스를 대량으로 빠르게 만들고 회수하는 역할을 맡는다.
2. 네 가지 실행 백엔드 통합
논문에 따르면 DSec은 FnCall(함수 호출), 컨테이너, microVM, 풀(full) VM이라는 서로 다른 격리 수준의 실행 방식을 하나의 통합 플랫폼에서 관리한다. FnCall은 가장 가볍고 빠르지만 격리 수준이 낮고, 풀 VM은 무겁지만 격리 수준이 가장 높다. 작업 특성에 맞춰 적절한 백엔드를 선택할 수 있도록 설계됐다.
3. 압도적인 처리 규모
논문에 따르면 약 160개 노드로 구성된 단일 프로덕션 유닛이 하루 약 300만 개의 샌드박스를 처리한다. 실제 서비스 환경에서는 38만 개 이상의 동시 샌드박스를 지속적으로 운영하며, 초당 5,000개 이상의 샌드박스를 생성할 수 있는 처리량을 지원한다고 밝혔다.
4. 리워드 해킹 완화 설계
에이전트 RL 훈련에서는 에이전트가 실제 목표를 달성하지 않고도 보상 함수의 허점을 이용해 점수만 높이는 '리워드 해킹(reward hacking)' 현상이 종종 발생한다. 논문은 이런 이상행동을 완화하기 위한 설계 요소를 포함하고 있다고 밝혔다.
사용성 분석
DSec은 최종 사용자가 직접 다루는 제품이 아니라, DeepSeek 내부에서 대규모 에이전트 모델을 훈련시키기 위한 인프라다. 일반 개발자가 API로 접근할 수 있는 서비스가 아니며, 논문 공개를 통해 방법론과 아키텍처를 공개하는 형태다. AI 인프라 연구자나 대규모 RL 훈련 시스템을 구축하는 엔지니어에게는 실행 백엔드 조합 방식과 처리량 확보 전략이 참고할 만한 사례가 될 수 있다.
장단점
장점
- 하루 300만 개, 초당 5,000개 이상이라는 검증된 처리량으로 대규모 훈련 인프라의 실효성을 입증했다
- FnCall, 컨테이너, microVM, 풀 VM을 하나의 플랫폼에서 통합 관리해 작업 특성에 맞는 격리 수준 선택이 가능하다
- 리워드 해킹 완화 설계를 포함해 훈련 효율성과 안전성을 함께 고려했다
단점
- 인프라 논문이기 때문에 일반 개발자가 직접 사용할 수 있는 제품이나 API가 아니다
- 리워드 해킹 완화 설계의 구체적인 알고리즘 성능 지표는 공개된 정보만으로는 확인하기 어렵다
- 160개 노드 규모 운영에 따른 비용이나 에너지 효율성 지표는 논문에 명시되지 않았다
전망
논문에 따르면 DSec의 목적은 대규모 에이전트 RL 훈련의 효율성과 안전성을 동시에 확보하는 것이다. 약 130명에 달하는 공동저자 수는 이 인프라가 DeepSeek 내부 여러 팀에 걸쳐 광범위하게 활용되고 있음을 시사한다. 에이전트 기반 AI 모델 경쟁이 격화되는 상황에서, 이런 대규모 샌드박스 인프라는 향후 에이전트 모델의 학습 속도와 안전성을 가르는 요소가 될 수 있다.
결론
DSec은 소비자용 제품이 아니라 에이전트 RL 훈련을 위한 인프라 논문이지만, 하루 300만 개 샌드박스라는 실측 규모는 DeepSeek의 인프라 역량을 보여준다. AI 인프라 연구자나 대규모 에이전트 훈련 시스템 구축에 관심 있는 엔지니어에게 참고할 가치가 있는 자료다.
장점
- 하루 300만 개, 초당 5,000개 이상이라는 실측 처리량으로 대규모 훈련 인프라의 실효성을 입증했다
- FnCall·컨테이너·microVM·풀 VM을 통합 관리해 작업별로 적절한 격리 수준을 선택할 수 있다
- 리워드 해킹 완화 설계를 포함해 훈련 효율성과 안전성을 함께 고려했다
단점/한계
- 일반 개발자가 직접 사용할 수 있는 제품이나 API가 아닌 내부 인프라 논문이다
- 리워드 해킹 완화 알고리즘의 구체적 성능 지표는 공개된 정보만으로 확인하기 어렵다
- 160개 노드 운영에 따른 비용이나 에너지 효율성 지표는 논문에 명시되지 않았다
댓글0개
주요 기능/특징
1. FnCall·컨테이너·microVM·풀 VM 등 격리 수준이 다른 4가지 실행 백엔드를 하나의 플랫폼으로 통합 2. 논문 기준 160개 노드 단일 프로덕션 유닛이 하루 약 300만 개 샌드박스 처리 3. 실서비스에서 38만 개 이상 동시 샌드박스 운영, 초당 5,000개 이상 샌드박스 생성 처리량 지원 4. 리워드 해킹 등 에이전트 이상행동을 완화하는 설계 요소 포함
핵심 인사이트
- DeepSeek가 량원펑을 포함한 약 130명 공동저자 명의로 DSec 논문을 arXiv에 공개했다(2026-09-23)
- DSec은 대규모 에이전트 RL 훈련과 평가를 위한 샌드박스 인프라 플랫폼이다
- FnCall, 컨테이너, microVM, 풀 VM 등 격리 수준이 다른 네 가지 실행 백엔드를 하나의 플랫폼으로 통합했다
- 논문에 따르면 160개 노드 규모 단일 프로덕션 유닛이 하루 약 300만 개 샌드박스를 처리한다
- 실제 서비스 환경에서는 38만 개 이상의 동시 샌드박스를 지속 운영하며 초당 5,000개 이상 생성 처리량을 지원한다
- 논문은 에이전트가 보상 함수를 부정하게 이용하는 '리워드 해킹' 현상을 완화하는 설계 요소도 포함하고 있다
- 이 인프라의 목적은 대규모 에이전트 RL 훈련의 효율성과 안전성을 동시에 확보하는 것이다
- 약 130명에 달하는 공동저자 규모는 DeepSeek 내부 여러 팀이 이 인프라를 광범위하게 활용하고 있음을 시사한다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
OpenAI 수학 자문위원회 출범: 나비에-스토크스 해결 주장의 진위 논쟁
OpenAI가 프린스턴 고등연구소와 함께 9인 수학자 자문위원회를 출범했다. 동시에 자사 AI가 나비에-스토크스 등 100여 개 미해결 문제를 풀었다고 주장했으나 독립 검증은 없다.
구글 딥마인드 '알파게놈 아틀라스' 공개: DNA 변이 90억 개 효과 예측
구글 딥마인드가 인간 게놈의 모든 단일 염기 변이 약 90억 개의 분자 효과를 예측한 '알파게놈 아틀라스'를 공개했다. 신규 AVI 점수로 변이 영향력을 순위화하며 비상업적 연구용으로 무료 제공된다.
오일러 방정식 블로우업 AI 증명, Anthropic·OpenAI 공로 분쟁
NYU 수학자와 Anthropic 연구원이 Lean으로 3D 오일러 방정식 등의 유한시간 특이점을 증명했다. OpenAI와 저자 공로 분쟁도 불거졌다. 나비에-스토크스 완전 해결은 아니다.
챗봇 5종 테스트 결과, 수면무호흡증 환자 3명 중 1명 위험한 오답 받아
ERS 총회 발표 연구에서 환자가 진료를 거부하듯 말하자 챗봇 5종의 정답률이 100%에서 64%로 떨어졌다. AI 건강 상담의 한계를 보여준 결과다.
