Reflection AI Beam 발표: 501B 희소 MoE 오픈웨이트 모델, 가중치는 공개 예정
Reflection AI가 2026년 10월 5일 첫 오픈웨이트 모델 Beam을 발표했다. 총 501B, 활성 23B의 희소 MoE이며 Apache 2.0 가중치는 10월 중 공개 예정이다. 벤치마크는 자체 보고다.
Reflection AI가 2026년 10월 5일 첫 오픈웨이트 모델 Beam을 발표했다. 총 501B, 활성 23B의 희소 MoE이며 Apache 2.0 가중치는 10월 중 공개 예정이다. 벤치마크는 자체 보고다.
핵심 요약
Reflection AI가 2026년 10월 5일 첫 오픈웨이트 모델 Beam을 발표했다. 코딩, 추론, 에이전트 워크로드를 겨냥한 희소 MoE(Mixture of Experts) 모델이다. 총 파라미터는 5010억(501B)이고, 토큰마다 활성화되는 파라미터는 230억(23B)이다. 라이선스는 Apache 2.0이다. 다만 가중치와 기술 문서는 2026년 10월 중 공개 예정이며 아직 공개되지 않았다. 이 글은 공식 발표와 Unite.ai, Technology.org, MLQ.ai, AlphaSignal 보도를 바탕으로 작성했다.
주요 기능
1. 희소 MoE 구조
MoE는 전체 파라미터 중 일부 전문가만 골라 계산하는 구조다. Beam은 총 501B 중 23B만 활성화한다. 모델 용량은 크게 가져가면서 토큰당 연산은 줄이려는 설계다.
2. 사전학습과 데이터 큐레이션
사전학습에는 23.8조 토큰이 쓰였다. 웹 데이터, 공개 데이터, 라이선스된 독점 데이터가 섞여 있다. 회사는 원시 인터넷 토큰의 95%를 제거하는 큐레이션을 거쳤다고 설명한다(근사치로 보고됨). 학습은 6,144개의 NVIDIA GB300 NVL72 GPU에서 4주 미만이 걸렸다(Unite.ai 인용).
3. 컨텍스트와 후속 학습
최대 컨텍스트는 256K다. 공식 발표에 따르면 중간학습(mid-training)으로 1M까지 확장할 수 있다. 후속 단계에서는 1억 건 이상의 롤아웃을 쓰는 고연산 강화학습을 적용했다.
4. 추론 노력 조절과 도구 사용
추론 노력(reasoning effort) 파라미터로 응답 전에 쓰는 추론량을 조절한다. 도구 사용, 웹 검색, 샌드박스 코드 실행도 지원한다.
5. 추론 효율
회사는 GLM-5.2와 유사한 추론 점수를 추론 연산 3~4배 적게 쓰고 얻는다고 밝혔다. 이는 회사 측 근사치이며 실측 비용이 아니다.
벤치마크 (회사 보고)
아래 수치는 Unite.ai가 인용한 Reflection AI의 자체 보고이며 독립 검증은 확인되지 않았다.
| 벤치마크 | 점수 |
|---|---|
| Terminal Bench v2.1 | 80.1 |
| SWE-Bench Verified | 80.9 |
| AIME 2026 | 97.8 |
| GPQA Diamond | 90.5 |
사용성 분석
현재 Beam은 누구나 내려받을 수 없다. platform.reflection.ai 대기자 명단을 통해 일부 사용자만 조기 접근 중이다. 가격은 공개되지 않았다. 활성 파라미터가 23B이므로 추론 연산 부담은 줄 수 있다. 다만 501B 전체를 메모리에 올려야 하는지 등 실제 배포 요건은 가중치와 기술 문서가 나와야 판단할 수 있다. 에이전트 용도의 성능은 공개 평가가 나온 뒤 직접 검증할 필요가 있다.
장점과 한계
장점은 Apache 2.0 라이선스 계획, 대형 MoE 대비 낮은 활성 파라미터, 도구 사용과 추론 조절 지원이다. 한계는 세 가지다. 가중치가 아직 없고, 벤치마크가 모두 자체 보고이며, 에이전트 관련 평가가 독립 검증을 거치지 않았다. 최종 레드팀과 평가도 진행 중이다.
전망
Reflection AI는 이번에 처음 오픈웨이트 모델을 내놓는다. 가중치가 약속대로 공개되면 커뮤니티가 재현과 평가를 할 수 있게 된다. 일부 보도는 중국 연구소의 오픈웨이트 모델과 경쟁하는 모델로 소개한다. 효율 주장이 실측에서도 확인되는지가 핵심 확인 지점이다. 이 해석은 필자의 분석이다.
결론
Beam은 코딩과 에이전트용 대형 오픈웨이트 모델을 찾는 연구자와 개발팀이 주시할 만한 후보다. 지금은 가중치, 가격, 독립 평가가 모두 없는 단계다. 이를 반영해 평점은 3점으로 평가한다.
장점
- Apache 2.0 라이선스로 공개될 예정
- 501B 용량에 활성 23B로 토큰당 연산 부담이 낮은 MoE 설계
- 256K 컨텍스트와 추론 노력 조절, 도구 사용 지원
단점/한계
- 가중치와 기술 문서가 아직 공개되지 않음
- 벤치마크와 효율 수치가 모두 회사 자체 보고
- 에이전트 평가에 대한 독립 검증이 없고 가격도 미공개
댓글0개
주요 기능/특징
1. 501B 총 파라미터, 23B 활성의 희소 MoE 2. 23.8조 토큰 사전학습, 6,144개 GB300 NVL72 GPU로 4주 미만 3. 256K 컨텍스트, 중간학습으로 1M 확장 가능(공식) 4. 1억 건 이상 롤아웃 강화학습, 추론 노력 조절 파라미터 5. 도구 사용, 웹 검색, 샌드박스 실행 지원 6. Apache 2.0, 가중치는 2026년 10월 중 공개 예정
핵심 인사이트
- Beam은 Reflection AI의 첫 오픈웨이트 모델이며 코딩, 추론, 에이전트 워크로드를 겨냥한다
- 총 501B 중 23B만 활성화하는 희소 MoE로 용량과 토큰당 연산을 분리하는 설계다
- 23.8조 토큰 학습에서 원시 인터넷 토큰의 95%를 제거하는 큐레이션을 강조한다
- 256K 컨텍스트에 중간학습으로 1M 확장이 가능하다고 공식 발표했다
- GLM-5.2와 유사한 추론 점수를 연산 3~4배 적게 쓴다는 주장은 회사 측 근사치이며 실측 비용이 아니다
- Terminal Bench v2.1 80.1, SWE-Bench Verified 80.9 등 모든 벤치마크는 자체 보고다
- Apache 2.0이지만 가중치와 기술 문서는 10월 중 공개 예정이라 현재는 대기자 명단 조기 접근만 가능하다
- 에이전트 평가는 독립 검증 전이며 가격도 미공개라 도입 판단은 이르다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
Ai2 Olmo-core 3: 오픈 MoE 학습 스택, B300 처리량 2.7배
Ai2가 대형 MoE 모델 학습용 오픈 스택 Olmo-core 3를 공개했다. 8개 B300에서 47B MoE 처리량이 19,400에서 52,000 tokens/s로 올랐다고 밝혔다. 대규모 학습 인프라 팀에 유용하다.
Perplexity pplx-embed-v2-context-9b-preview: 근거 청크까지 찾는 임베딩
Perplexity가 문서 맥락 속에서 청크를 인코딩하는 컨텍스트 임베딩 모델을 MIT 라이선스로 공개했다. 정답과 근거 청크를 함께 검색하도록 학습했으며 RAG 개발자에게 유용하다.
Google Gemma 오픈모델 다운로드 10억 건 돌파, 변형 10만 종 확산
Google이 Gemma 오픈모델 누적 다운로드 10억 건 돌파를 공식 발표했다(2026-08-20). 커뮤니티 변형 모델 10만 종 이상, 우주·헬스케어·암 연구 등에 활용된다.
엔비디아 Nemotron 3.5 Lightning 출시: 30B 경량모델+NeMo Switchyard
엔비디아가 30B(활성 3B) 파라미터 경량 오픈모델 Nemotron 3.5 Lightning과 자동 모델 라우팅 라이브러리 NeMo Switchyard를 공개했다. 단일 GPU로 구동 가능한 에이전트용 모델이다.
