Reflection이 공개한 501B 매개변수 오픈 MoE 모델 Beam
요약
Reflection AI가 5,010억 개의 매개변수를 가진 오픈 MoE 모델 Beam을 발표했습니다. 이 모델은 토큰당 230억 개의 활성 매개변수만을 사용하여 효율성을 극대화했으며, 코딩 및 에이전트 작업에 최적화되었습니다. 추론 연산량 면에서 경쟁 모델 대비 3~4배 적게 사용하며 동등하거나 우수한 성능을 보일 것으로 기대됩니다.
핵심 포인트
- 총 5,010억 개 매개변수, 활성 매개변수는 토큰당 230억 개로 설계됨.
- MoE 구조를 활용하여 메모리 용량 대비 추론 효율성을 극대화함.
- 코딩, 추론 및 에이전트 작업에 특화되어 개발될 예정임.
- 경쟁 모델 대비 낮은 추론 연산량으로 높은 효율성을 자랑함.
Reflection AI가 총 5,010억 개의 매개변수를 가진 오픈형 전문가 혼합(Mixture of Experts, MoE) 시스템인 Beam 모델을 발표했습니다. 이 모델은 토큰당 230억 개의 활성 매개변수만을 사용합니다. 이 스타트업은 코딩, 추론 및 에이전트 작업에 맞춰 모델을 훈련했으며, 이번 달에 가중치를 공개할 예정입니다.
가장 주목할 만한 점은 크기가 아니라 효율성입니다. Reflection에 따르면, Beam은 GLM-5.2와 같은 오픈 경쟁 모델들과 비교했을 때 생성되는 토큰당 추론 연산량을 3~4배 적게 사용하여 동등하거나 더 나은 성능을 보였습니다.
요약 (TL;DR)
- Reflection이 총 5,010억 개의 매개변수와 230억 개의 활성 매개변수를 가진 MoE 모델 Beam을 출시했습니다.- 훈련에는 238억 개의 토큰과 GPU GB300에서 1억 개 이상의 RL(강화학습) 롤아웃이 사용되었습니다.- Beam은 추론 연산량 면에서 GLM-5.2와 비교하여 3~4배 적게 사용하여 추론 성능을 보여줍니다.- 가중치, 기술 보고서 및 개발자 도구는 이번 달에 출시될 예정입니다.- 모델의 사전 접근 권한을 열기 전에 최종 레드팀(red-teaming) 작업이 남아 있습니다.
오픈 모델 Beam이란 무엇인가요?
오픈 모델 Beam은 소프트웨어 에이전트용 언어 모델에 초점을 맞춘 스타트업인 Reflection AI가 공개하는 첫 번째 가중치 패밀리입니다. 이 모델은 총 5,010억 개의 매개변수를 가진 전문가 혼합(MoE) 모델이며, 토큰당 230억 개의 활성 매개변수를 사용하도록 설계되었으며, 프로그래밍, 추론 및 도구 사용에 적합합니다.
전문가 혼합(Mixture of Experts, MoE) 아키텍처는 네트워크를 '전문가'라고 불리는 전문화된 블록으로 나누고, 각 토큰마다 일부 전문가만을 활성화하는 방식입니다. 이 때문에 Beam은 메모리에 5,010억 개의 매개변수를 로드하지만, 실제 토큰당 계산에는 단지 230억 개만 사용하며 이는 약 22배 적습니다. 이는 GLM-5.2나 Kimi K3가 사용하는 것과 동일한 논리이지만, Reflection은 이를 다른 규모의 강화 학습(RL) 훈련과 결합했습니다.
Beam은 웹 및 라이선스 데이터를 활용하여 238억 개의 토큰으로 사전 훈련된 후 RL을 거쳤습니다.
Reflection은 Beam을 두 가지 기둥 위에 구축했습니다. 첫 번째는 웹 및 라이선스 데이터셋에서 선별된 [238억 개의 토큰]으로 사전 훈련한 것이며, 이를 통해 회사는 유사한 크기의 오픈 기반 모델에 필적하거나 능가한다고 말합니다.
두 번째 기둥은 대규모 강화 학습(RL) 실행이었습니다. Reflection은 이러한 컴퓨팅을 지원하기 위해 자체 알고리즘, 훈련 환경 및 인프라를 개발했으며, 4주 동안 10,500대의 GPU NVIDIA GB300에서 [1억 개 이상의 롤아웃]을 생성했습니다.
회사는 이 실행을 오픈 연구소에서 보고된 가장 큰 규모 중 하나라고 설명합니다. 이는 오직 Reflection만이 자체 기록으로 확인할 수 있는 수치이지만, 보고서에 상세히 기술된 롤아웃 및 훈련 샌드박스 양은 이러한 주장을 뒷받침합니다.
이 모델은 아직 최종 레드팀(red-teaming) 단계와 보안 평가를 거치고 있습니다. Reflection은 조기 액세스를 위한 대기자 명단을 열었으며, 가중치(weights), 기술 보고서, 모델 카드 및 개발자 도구는 이달 중으로 공개될 것이라고 발표했습니다.
배경: 오픈 모델 경쟁
Reflection은 Beam을 서방의 오픈 프론티어(frontier)를 밀어붙이는 모델로 포지셔닝합니다. 코드 및 에이전트 사용 벤치마크에서 회사는 이를 GLM-5.2와 같은 더 큰 오픈 모델들과 경쟁력이 있으며, Qwen 3.8-Max에 근접하다고 설명합니다. Kimi K3와 같은 모델은 순수한 능력(raw capacity) 면에서는 여전히 앞서 있지만, Reflection은 Beam의 강점은 모든 벤치마크에서 이기는 것이 아니라 추론 시 효율성에 있다고 주장합니다.
비교 대상에는 또한 GLM-5.3, Nemotron 3 Ultra, DeepSeek V4.1 Flash 및 Thinking Machines의 전문가 혼합(Mixture of Experts) 모델인 Inkling이 포함됩니다. 모두 오늘날 동일한 범주, 즉 프로그래밍과 도구 자율 운영을 위해 설계된 대규모 오픈 가중치 모델로 경쟁하고 있습니다.
명확히 하자면: 오늘날 벤치마크 순위에서 선두를 달리는 대부분의 오픈 모델(GLM, Kimi, Qwen, DeepSeek)은 중국 연구소 출신입니다. Reflection은 Beam을 이러한 블록 외부에서 훈련된 오픈 옵션으로 명시적으로 포지셔닝하고 있으며, 이는 내부 정책상 중국 모델이나 폐쇄형 API에 의존하기를 선호하는 기업들에게 중요한 요소입니다.
내부 작동 방식: Beam의 메커니즘
Beam을 구축하는 데 가장 비쌌던 부분은 사전 훈련이 아니라 RL(강화학습) 실행이었습니다. Reflection은 최대 256,000 토큰의 컨텍스트 창으로 1억 개 이상의 롤아웃을 생성하기 위해 4주 동안 NVIDIA GB300 GPU 10,500개를 사용했습니다. 이 롤아웃들을 평가하고 훈련시키기 위해, 회사는 이 실행을 위해 Reflection이 특별히 구축한 백만 개의 프로그래밍 환경, 에이전트 사용 및 과학 환경에 의해 구동되는 약 13억 개의 샌드박스를 실행했습니다.
이를 마치 백만 건의 시뮬레이션된 사례가 있는 응급실이라고 생각해 보세요: 각 샌드박스는 코드 문제나 도구 사용에 대한 실제 문제를 가진 환자이며, 모델은 얼마나 정확했는지에 대한 평가를 받습니다. 충분한 사례와 충분한 평가를 통해, 모델은 단순히 훈련 데이터와 유사한 텍스트를 반복하는 것이 아니라, 모든 유형의 문제에서 어떤 추론 전략이 가장 잘 작동하는지 학습합니다.
Reflection의 보고서에 따르면, RL 컴퓨팅이 증가함에 따라 모델의 역량은 정체 신호 없이 계속 개선되었습니다. 규모를 가늠할 수 있도록, 회사는 자사의 실행을 Inkling에 사용된 3천만 개의 롤아웃과 MiMo의 75만 3천 개와 비교합니다: Beam은 이 두 모델보다 3배에서 최대 130배 더 많은 볼륨의 롤아웃으로 훈련되었습니다.
flowchart TD
A["사전 훈련: 23.8T 토큰"] --> B["대규모 RL: GB300 GPU 10,500개, 4주"]
B --> C["1억 개 이상 롤아웃, 13억 개 샌드박스"]
...```
Reflection은 Beam의 추정 FLOPs 효율성을 측정했으며, 이는 실제 프로덕션에서 측정한 추론 비용이 아닙니다. 이 계산은 활성화된 파라미터 수에 시도당 생성되는 토큰 수를 곱하고, 프롬프트의 prefill, 문맥 의존적 어텐션(attention), 서비스 오버헤드는 제외합니다. Reflection이 그래프 뒤에 실제 추론 실행 기록을 공개하지 않고 단지 추정 방법론만 제시했기 때문에 외부에서 이 비교를 직접 검증할 방법은 없습니다.
| 모델 | Terminal-Bench v2.1 | GPQA Diamond | HLE (도구 없음) |
| :--- | :---: | :---: | :---:
| Beam | 80.1 | 90.5 | 36.2 |
| GLM-5.2 | 81.0 | 91.2 | 40.5 |
| GLM-5.3 | 88.2 | 91.7 | 42.3 |
| Kimi K3 | 88.3 | 93.5 | 46.9 |
| Qwen 3.8-Max | 86.6 | 92.6 | 43.6 |
| DeepSeek V4.1 Flash | 90.6 | 90.9 | 39.1 |
| Nemotron 3 Ultra | 56.4 | 87.0 | 26.7 |
| Inkling | 63.8 | 87.2 | 29.7 |
이 수치들은 Reflection 자체 보고서와 회사가 경쟁 모델의 기준으로 사용하는 [Artificial Analysis](https://artificialanalysis.ai/) 데이터에서 가져온 것입니다. Beam은 이 세 가지 벤치마크에서 GLM-5.3, Kimi K3, Qwen 3.8-Max보다 낮은 수치를 기록했지만, Reflection은 해당 모델들이 그 수준에 도달하기 위해 토큰당 훨씬 더 많은 파라미터를 활성화해야 한다고 주장합니다.
Beam의 RL 실행에는 GB300 GPU 10,500개가 연속적으로 4주 동안 사용되었습니다.
## 영향 및 분석
오픈 모델인 Beam은 단순히 가장 높은 벤치마크 점수로만 승리하는 시대가 아니라는 것을 보여줍니다. 각 응답에 드는 비용으로도 승리합니다. 만약 LATAM의 한 기업이 규모 있는 코드 어시스턴트를 배포해야 한다면, Qwen 3.8-Max와 같은 모델이 토큰당 활성화시키는 2조 개 이상의 파라미터에 돈을 지불하는 것보다, 23조 개의 활성화된 파라미터에 비용을 지불하는 것이 훨씬 저렴합니다.
이는 누가 오픈 모델의 선두 주자인지에 대한 논쟁을 종결짓지 않습니다. Kimi K3, GLM-5.3, DeepSeek V4.1 Flash는 여전히 앞서 언급된 거의 모든 벤치마크에서 Beam보다 우위에 있습니다. 달라진 점은 이제 중국 외 지역에서 훈련되었으며, 효율성을 명시적으로 제시하는 제안을 가지고 같은 카테고리에서 경쟁하는 오픈 옵션이 생겼다는 것입니다.
💭 Clave:
Beam은 표에서 가장 유능한 모델이 되려는 것이 아닙니다. 최고 수준에 근접하면서도 실행 비용이 가장 저렴한 모델이 되는 것을 목표로 합니다.
## Beam의 향후 계획
Reflection은 아직 Beam의 가중치(weights)를 공개하지 않았습니다. 이 회사는 최종 red-teaming을 완료하고 2026년 10월 남은 기간 동안 가중치, 기술 보고서, 모델 카드 및 개발자 도구를 공개할 것이라고 밝혔습니다. 그때까지는 대기 목록으로만 접근이 가능합니다.
일정이 지켜진다면, Beam은 GLM-5.2, GLM-5.3, Kimi K3, Qwen 3.8-Max, DeepSeek V4.1 Flash와 같은 옵션에 추가되어 폐쇄형 API에 의존하지 않고 로컬 또는 자체 인프라에서 실행할 수 있는 선택지를 제공하게 될 것입니다.
📖 Telegram 요약: [요약 보기](https://telegra.ph/Reflection-presenta-Beam-MoE-abierto-de-501B-par%C3%A1metros-10-05)
직접 사용해보기: 이번 달 가중치가 공개되는 대로 Beam을 실행하려면 [Reflection AI 공식 블로그](https://reflection.ai/blog/introducing-beam)에서 사전 액세스 대기 목록에 등록하세요.
## 자주 묻는 질문 (FAQ)
### Reflection AI의 Beam 가중치는 언제 공개되나요?
Reflection은 최종 red-teaming을 마친 후, 가중치, 기술 보고서, 모델 카드 및 개발자 도구를 2026년 10월 남은 기간 동안 공개할 계획이라고 발표했습니다.
### Beam은 토큰당 몇 개의 파라미터를 활성화하나요?
Beam은 총 5,010억 개 중 230억 개의 파라미터를 토큰당 활성화합니다. 이는 전문가 혼합(Mixture of Experts, MoE) 아키텍처이므로 계산 단계마다 대부분의 파라미터는 비활성 상태로 남아 있습니다.
### Beam은 GLM-5.2나 Qwen 3.8-Max보다 나은가요?
GPQA Diamond 및 Terminal-Bench v2.1과 같은 벤치마크에서 Beam은 GLM-5.2와 Qwen 3.8-Max에 근소하게 미치지 못합니다. Reflection은 실제 차이점은 효율성에 있다고 주장하며, 유사한 결과를 얻기 위해 Beam은 GLM-5.2보다 토큰당 3~4배 적은 컴퓨팅 자원을 필요로 한다고 말했습니다.
### Reflection AI는 Beam을 훈련하는 데 어떤 하드웨어를 사용했나요?
강화학습(RL) 과정에서는 4주 동안 NVIDIA GB300 GPU 10,500개를 사용했으며, 최대 256,000 토큰의 컨텍스트를 가진 1억 개 이상의 롤아웃을 생성했습니다.
### Beam은 오늘 테스트할 수 있나요?
아니요. Beam은 최종 레드팀(red-teaming) 단계에 있으며, Reflection은 조기 접근을 위한 대기자 명단만 제공합니다. 회사에 따르면 공개 가중치(public weights)는 이달 안에 공개될 예정입니다.
## 참고 자료
- [Reflection AI](https://reflection.ai/blog/introducing-beam): Beam의 공식 발표로, 벤치마크, RL 방법론 및 배포 일정이 포함되어 있습니다.
- [Wikipedia](https://en.wikipedia.org/wiki/Mixture_of_experts): 전문가 혼합(MoE) 아키텍처에 대한 일반적인 설명입니다.
- [Artificial Analysis](https://artificialanalysis.ai/): Reflection이 Beam을 다른 모델과 비교하는 데 사용한 데이터 출처입니다.
- [NVIDIA](https://www.nvidia.com/): Beam의 RL 과정에 사용된 GPU GB300의 제조사입니다.
📱 **이 콘텐츠가 마음에 드시나요?** 저희 Telegram 채널 [@programacion](https://t.me/programacion)에 참여하여 기술, AI 및 개발 분야에서 가장 관련성 높은 정보를 매일 받아보세요. 빠른 요약과 신선한 콘텐츠를 매일 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기