2026.10.03
1
0
0
오픈소스NEW

Ai2 Olmo-core 3: 오픈 MoE 학습 스택, B300 처리량 2.7배

Ai2가 대형 MoE 모델 학습용 오픈 스택 Olmo-core 3를 공개했다. 8개 B300에서 47B MoE 처리량이 19,400에서 52,000 tokens/s로 올랐다고 밝혔다. 대규모 학습 인프라 팀에 유용하다.

#Ai2#Olmo-core#MoE#오픈소스#LLM 학습
Ai2 Olmo-core 3: 오픈 MoE 학습 스택, B300 처리량 2.7배
AI 핵심 요약

Ai2가 대형 MoE 모델 학습용 오픈 스택 Olmo-core 3를 공개했다. 8개 B300에서 47B MoE 처리량이 19,400에서 52,000 tokens/s로 올랐다고 밝혔다. 대규모 학습 인프라 팀에 유용하다.

핵심 요약

Ai2(Allen Institute for AI)가 2026년 10월 2일 Olmo-core 3를 발표했다. 대형 MoE(Mixture-of-Experts) LLM을 더 효율적으로 학습하도록 만든 오픈 학습 스택이다. 핵심 수치는 8개 NVIDIA B300에서 47B MoE 모델의 GPU당 처리량이 19,400 tokens/s에서 52,000 tokens/s로 오른 것이다. 약 2.7배다. 이 글의 모든 수치는 Ai2 발표 기준이며 독립 검증은 확인되지 않았다. 3월에 소개된 Olmo hybrid 7B 모델과는 별개의 발표다.

주요 기능

1. B300 처리량 향상

8개 B300 환경에서 47B MoE의 GPU당 처리량이 19,400에서 52,000 tokens/s로 상승했다. 같은 하드웨어에서 학습 시간과 비용을 줄일 수 있는 수준의 변화다. 다만 모델 구성과 설정에 따라 결과는 달라질 수 있다.

2. MXFP8 지원

MXFP8을 활성화하면 처리량이 약 21% 증가했다. 최대 활성 메모리는 103GB에서 95GB로 줄었다. 속도와 메모리를 동시에 개선했다는 점이 특징이다.

3. 512 GPU 대규모 벤치마크

512개 GPU에서 1.2T 파라미터(활성 58.36B) 모델을 벤치마크했다. 최고 858 TFLOP/s/GPU를 기록했다고 Ai2는 밝혔다.

4. 전문가 수 확장에 따른 처리량 유지

활성 전문가를 4개로 유지한 채 전체 전문가를 8개에서 128개로 늘려도 처리량 저하는 5% 미만이었다. 전문가 수를 키우는 설계를 시험할 때 부담이 작다는 의미다.

5. 2.38T 구성 시험

2.38T 파라미터 구성은 DeepEP v2로 시험한 단기 용량 테스트다. 전체 학습을 수행한 것이 아니다. 모델 크기의 한계를 점검한 결과로 읽어야 한다.

수치 요약

항목결과
47B MoE, 8x B300 GPU당 처리량19,400 → 52,000 tokens/s
MXFP8 활성화처리량 약 21% 증가
최대 활성 메모리103GB → 95GB
512 GPU, 1.2T(활성 58.36B)최고 858 TFLOP/s/GPU
전문가 8개 → 128개처리량 저하 5% 미만

사용성 분석

Olmo-core 3는 완성된 모델이 아니라 학습 스택이다. 따라서 대상은 사전학습이나 대규모 후속 학습을 직접 운영하는 연구 조직과 인프라 팀이다. B300 같은 최신 GPU와 다수의 노드가 있어야 발표된 수치를 재현해 볼 수 있다. 일반 개발자가 로컬에서 쓰는 도구는 아니다. 공개 스택이라는 점에서 자체 MoE 설계를 실험하려는 팀은 코드를 직접 확인하고 수정할 수 있다. 라이선스와 설치 절차는 이 글에서 다룬 출처로는 확인하지 못했으므로 공식 블로그와 저장소를 확인해야 한다.

장단점

장점은 B300 처리량 향상, MXFP8로 얻은 속도와 메모리 이득, 전문가 확장 시 낮은 성능 저하, 오픈 스택이라는 접근성이다. 한계는 수치가 Ai2 자체 발표라는 점, 고가의 최신 하드웨어 전제, 2.38T 구성이 전체 학습이 아닌 단기 용량 테스트라는 점이다.

전망

MoE는 활성 파라미터 대비 전체 파라미터를 키울 수 있어 대형 모델 설계에서 쓰인다. 학습 스택이 공개되면 소규모 연구 조직도 같은 구조를 실험하기 쉬워진다. 다만 다른 하드웨어나 프레임워크에서 같은 이득이 나오는지는 독립 재현 결과가 필요하다. 향후 이 스택으로 학습한 모델이 공개되는지도 지켜볼 부분이다.

결론

Olmo-core 3는 MoE 학습의 처리량과 메모리 효율을 개선했다고 주장하는 오픈 학습 스택이다. 수치는 인상적이지만 아직 Ai2 발표에 의존한다. 대규모 MoE 학습 인프라를 운영하는 팀이 우선 검토할 만하다. 일반 사용자에게는 직접적인 영향이 크지 않다.

장점

  • 8x B300에서 47B MoE 처리량을 19,400에서 52,000 tokens/s로 끌어올렸다고 보고
  • MXFP8로 처리량 약 21% 증가와 최대 활성 메모리 감소(103GB → 95GB)를 동시에 달성
  • 전문가 수를 128개까지 늘려도 처리량 저하 5% 미만
  • 오픈 스택이라 자체 MoE 설계를 직접 실험하고 수정할 수 있음

단점/한계

  • 모든 성능 수치가 Ai2 발표 기준이며 독립 검증이 확인되지 않음
  • B300 등 최신 고가 GPU와 대규모 클러스터가 있어야 재현 가능
  • 2.38T 구성은 단기 용량 테스트일 뿐 전체 학습 결과가 아님
  • 모델이 아닌 학습 스택이라 일반 사용자에게는 직접적 혜택이 제한적

댓글0개

주요 기능/특징

1. 8x B300에서 47B MoE GPU당 처리량 19,400 → 52,000 tokens/s (약 2.7배) 2. MXFP8 활성화 시 처리량 약 21% 증가, 최대 활성 메모리 103GB → 95GB 3. 512 GPU에서 1.2T(활성 58.36B) 모델 벤치마크, 최고 858 TFLOP/s/GPU 4. 전문가 8개 → 128개 확장 시(활성 4개) 처리량 저하 5% 미만 5. 2.38T 구성은 DeepEP v2 기반 단기 용량 테스트(전체 학습 아님)

핵심 인사이트

  • Olmo-core 3는 모델이 아니라 대형 MoE 학습을 위한 오픈 스택이며, 3월 Olmo hybrid 7B와는 별개의 발표다
  • 8개 B300에서 47B MoE의 GPU당 처리량이 19,400에서 52,000 tokens/s로 올라 약 2.7배 향상됐다 (Ai2 발표)
  • MXFP8은 처리량을 약 21% 높이고 최대 활성 메모리를 103GB에서 95GB로 낮춰 속도와 메모리를 함께 개선했다
  • 512 GPU에서 1.2T(활성 58.36B) 모델이 최고 858 TFLOP/s/GPU를 기록해 대규모 클러스터 효율을 제시했다
  • 활성 전문가 4개를 유지하며 전문가를 8개에서 128개로 늘려도 처리량 저하가 5% 미만이라 전문가 확장 실험의 부담이 작다
  • 2.38T 구성은 DeepEP v2로 시험한 단기 용량 테스트이며 전체 학습을 수행한 것이 아니다
  • 모든 수치는 Ai2 발표 기준이며 독립 검증은 확인되지 않아 자체 환경에서의 재현 확인이 필요하다
  • B300급 하드웨어와 다수 GPU가 전제되므로 주 대상은 대규모 학습 인프라를 운영하는 연구 조직이다

이 리뷰가 유용했나요?

공유하기