
Reflection, 효율적인 오픈웨이트 모델 Beam 공개
서구 AI 연구소들이 효율적인 오픈웨이트 모델 분야에서 중국의 DeepSeek 및 Zhipu(Z.ai)와 경쟁을 시도하고 있다. Reflection의 Beam은 5010억 개의 파라미터를 가진 희소 MoE(Mixture of Experts) 모델로, 매우 효율적인 것으로 알려졌다.
Reflection의 Beam은 5010억 개의 파라미터를 갖췄지만, 특정 시점에는 230억 개만 활성화된다. MoE를 이해하기 위해, 수많은 전문 셰프(라우팅된 전문가)가 있는 대형 주방을 상상할 수 있다. 이 모델은 필요할 때만 전문 셰프를 활성화한다. 예를 들어, 수플레를 준비할 때 모델은 동양 요리 전문가가 아닌 디저트 전문가만 활성화한다.
AI 모델은 기본적으로 두 가지 핵심 요소로 구성된 일련의 트랜스포머 블록으로 이루어진다. 그러나 KV 캐시가 너무 커지는 것을 방지하고 효율성을 높이기 위해 Beam은 여러 가지 기술을 사용한다. Beam은 SandwichNorm, 어텐션 게이팅, 깊이 기반 잔차 스케일링을 통해 정책 노후화로 인한 노이즈와 수치적 불일치를 상쇄한다. 이러한 기술을 활용하여 Reflection은 Beam의 훈련 속도를 크게 높였다.
Reflection은 Beam을 4주(28일) 동안 훈련했으며, 10,500개의 NVIDIA GB300 GPU에 걸쳐 13억 개의 샌드박스를 사용했다고 밝혔다. 이는 하루에 4,640만 개의 샌드박스에 해당한다. RL(강화 학습)은 100만 개의 코딩, 에이전트, STEM 환경에 걸쳐 진행되었으며, 1억 번의 롤아웃(에이전트가 주어진 환경과 상호 작용할 때 생성되는 결과 및 보상)을 포함했다.
DeepSeek의 독점 DSec 유닛은 300만 개의 샌드박스를 처리한다. Reflection의 규모와 동등한 수준을 달성하려면 DeepSeek은 약 16개의 DSec 유닛을 운영해야 하며, 각 유닛은 656개의 GB300(총 약 10,500개의 GPU)을 사용한다. 일반적으로 강화 학습에서는 이전 세션에서 학습된 결과로 모델 가중치가 업데이트될 때 훈련이 일시 중지되어야 한다. 그러나 Reflection은 파이프라인을 분리했다.
그 결과 Beam의 성능은 GLM-5.2와 거의 일치하며, 추론 관련 컴퓨팅 요구량은 약 3~4배 적다. 물론 Beam은 여전히 Qwen 3.8 Max에 비해 순위가 낮지만, 크기에 비해 매우 강력한 모델이다.




도