Reflection AI의 Beam 모델: 230억 활성 파라미터가 5010억보다 중요한 이유
요약
Reflection AI가 5,010억 개의 총 파라미터를 가진 오픈 웨이트 MoE 모델 'Beam'을 공개했습니다. 이 모델은 토큰당 약 230억 개의 활성 파라미터만 사용하며, 대규모 강화학습과 100만 토큰 컨텍스트 확장을 통해 높은 성능을 목표로 합니다. 이는 거대한 크기보다 효율적인 추론 컴퓨팅이 중요함을 보여줍니다.
핵심 포인트
- MoE 구조를 활용하여 총 파라미터(5,010억)와 활성 파라미터(230억)의 차이를 강조했습니다.
- 대규모 강화학습과 23조 토큰 학습을 통해 코딩 및 에이전트 작업에 최적화되었습니다.
- MoE 구조 덕분에 추론 컴퓨팅 비용을 기존 모델 대비 3~4배 절감할 수 있습니다.
- Apache 2.0 라이선스로 가중치와 도구를 배포하여 접근성을 높였습니다.
Reflection AI가 첫 번째 오픈 웨이트(open-weight) 모델인 Beam을 공개했습니다. 이 모델의 헤드라인 숫자는 5,010억 개의 파라미터를 가리킵니다. 하지만 개발자들이 실제로 주목해야 할 숫자는 230억입니다.
발표된 내용 (2026년 10월 5일)
- 아키텍처: 코딩, 추론(reasoning), 에이전트 작업에 맞춰 설계된 총 5,010억 개의 파라미터를 가진 희소 혼합 전문가(sparse Mixture-of-Experts, MoE) 모델이며 토큰당 약 230억 개의 활성 파라미터가 사용됩니다.
- 사전 학습 (Pretraining): GB300 NVL72 클러스터에서 4주 이내에 큐레이션된 23조 8천억 개의 토큰으로 학습되었습니다.
- 대규모 강화학습 (Reinforcement learning at scale): 4주 동안 NVIDIA GB300 GPU 10.5K개를 사용하여 1억 회 이상의 롤아웃(rollouts), 약 13억 개의 샌드박스, 그리고 거의 백만 개에 달하는 코딩, 에이전트, STEM 환경에서 진행되었습니다.
- 컨텍스트 (Context): 미훈련 과정(midtraining)을 통해 유효 컨텍스트를 100만 토큰까지 확장했습니다.
- 라이선스 및 시기: 현재 조기 접근(early access)이 가능합니다. Reflection은 가중치, 기술 보고서, 모델 카드, 파인튜닝 도구 등을 이달 말에 Apache 2.0 라이선스로 배포할 예정이라고 밝혔습니다.
기대와 실제 성능 비교
기대: 더 큰 오픈 모델은 더 많은 하드웨어와 답변당 더 큰 비용을 의미합니다.
실제: MoE 모델에서는 각 토큰에 대해 네트워크의 일부만 활성화됩니다. Reflection에 따르면 Beam은 고급 추론 벤치마크에서 GLM-5.2와 비교할 만한 점수를 기록하면서도, 추론 컴퓨팅(inference compute)을 약 3~4배 적게 사용하며, 코딩 및 에이전트 작업에서는 Qwen 3.8-Max에 근접한다고 보고했습니다. (이는 회사가 자체적으로 측정한 벤치마크이므로, 로드맵을 결정하기 전에 독립적인 평가를 기다리는 것이 좋습니다.)
이해하기 쉬운 비유
직원 500명의 전문의가 있는 병원을 상상해 보세요. 감기에 걸렸다고 해서 500명 모두를 만날 수는 없습니다. 분류 데스크(triage desk)에서 적합한 두세 명의 의사에게 안내받게 됩니다. 전체 직원이 병원이 '얼마나 많이 아는지'를 알려준다면, 방에 있는 의사들이 방문에 '얼마나 비용이 드는지'를 알려줍니다. MoE도 같은 원리로 작동합니다: 총 파라미터는 지식의 양을 나타내고, 활성 파라미터는 비용(비용)을 나타냅니다.
개발자로서 주목할 세 가지 사항
개발자로서 주목할 세 가지 사항
- **"토큰당 지능(Intelligence per token)\
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기