501B 저장, 23B 활성화: Reflection의 'Beam'과 오픈 웨이트 경쟁에서의 효율성 전환
요약
Reflection AI가 501B 파라미터의 MoE 모델 'Beam'을 공개했습니다. Beam은 토큰당 23B만 활성화하여 Z.ai GLM-5.2와 동등한 성능을 훨씬 적은 컴퓨팅 자원으로 달성합니다. 이는 오픈 웨이트 경쟁에서 효율성을 극대화하는 새로운 접근 방식을 제시하며, 추론 및 코딩 작업에 강점을 보입니다.
핵심 포인트
- MoE 구조를 활용하여 501B 파라미터를 저장하고 토큰당 23B만 활성화합니다.
- GLM-5.2와 동등한 성능을 획기적으로 낮은 추론 컴퓨팅 비용으로 달성했습니다.
- 오픈 웨이트 모델의 메모리 요구량(FP8 기준 501GB)과 계산 효율성의 차이를 명확히 했습니다.
- 고성능 강화학습 기반으로 훈련되어 추론, 코딩, 에이전트 작업에 최적화되었습니다.
한 줄 요약: Reflection AI는 약 47억 달러를 유치하고 공개 모델이 전무했던 브루클린 스타트업으로, Beam을 공개했습니다. Beam은 501B 파라미터의 텍스트 전용 MoE(Mixture-of-Experts)로, 토큰당 23B를 활성화하며 Z.ai의 GLM-5.2와 동등한 성능을 3~4배 적은 추론 컴퓨팅으로 달성한다고 주장하며 이달 Apache 2.0 웨이트를 배포합니다.
Reflection AI는 지난 10월 5일 첫 공개 모델을 선보였습니다. 두 명의 전직 Google DeepMind 연구원이 2024년에 설립하고 Nvidia, Sequoia, Lightspeed로부터 250억 달러의 프리머니(pre-money) 기업가치 평가를 받은 이 브루클린 스타트업은 이전까지 모델을 공개한 적이 없었습니다. Beam이 바로 그 증거입니다.
수치는 다음과 같습니다: 총 5,010억 개의 파라미터 중 토큰당 230억 개(4.6%)가 활성화되었습니다. 23조 8천억 개의 토큰으로 사전 학습되었으며, 100만 토큰의 컨텍스트 창을 가집니다. 발표에 따르면 이 모델은 추론(reasoning), 코딩, 에이전트 작업(agentic tasks)을 목표로 하는 **고성능 강화학습 (high-compute reinforcement learning)**으로 훈련되었습니다. 핵심 주장은 명확합니다: Z.ai의 GLM-5.2(총 7,440억 개, 활성화 400억 개)와 같은 최고의 중국 오픈 모델과 추론 벤치마크에서 성능을 맞추면서도
이것이 바로 Mixture-of-Experts(MoE)입니다. 모델은 501B 개의 지식 매개변수를 _저장_하지만, 토큰당 계산 비용은 23B에 대해서만 지불합니다. 밀집된(dense) 501B 모델이라면 토큰당 약 1,002 GFLOPs를 소모할 것이지만, Beam은 약 46을 소모하여 다른 최적화가 적용되기 전부터 21.8배 감소한 수치입니다. 본 게시물에 첨부된 노트북에는 이 계산과 함께 직접 실험해 볼 수 있는 간단한 라우터(router)가 포함되어 있습니다.
문제는 저장 공간 자체입니다. 501B 개의 모든 매개변수는 사용하든 안 하든 모두 저장되어야 하며, 이는 대략 FP8 기준으로 501 GB에 달합니다. 그리고 1M 토큰의 컨텍스트(context)에서는 KV 캐시가 무거워지는데 (저희 노트북은 제시된 예시적 가정 하에 약 340 GB로 추정합니다). Beam은 23B 모델처럼 계산하지만, 501B 모델처럼 _공간을 차지_합니다. 이것이 바로 '오픈 웨이트(open weights)'가 곧 '당신의 기기에서 구동된다'는 것을 의미하지 않는 이유입니다.
작동 방식: 희소성(sparsity) + 고계산(high-compute) 강화학습 (RL)
1. 라우터(router): 모든 토큰, 모든 레이어에서 501 중 23개 사용
모든 토큰은 레이어를 통과합니다. 각 MoE 레이어에서는 학습된 라우터가 모든 전문가(expert)의 점수를 매기고, 해당 토큰을 소수의 상위 k개(top-k subset) 전문가에게 전달합니다. 라우터는 토큰이 어떤 지식을 필요로 하는지 학습하고, 전문가는 그 지식을 보유합니다. 저희는 9월 26일 MoE 게시물에서 이 메커니즘을 다루었으며, 동일한 장치지만 새로운 규모를 적용했습니다.
Top-k 라우팅: 예시 다이어그램에서 24개 전문가 중 2개가 활성화되었습니다. Beam의 희소성은 23/501B ≈ 4.6%입니다.
2. 고계산 강화학습 (High-compute RL)
발표 내용 중 가장 흥미로운 부분은 매개변수 개수가 아니라 학습 방식입니다. '고계산 RL'이란, 추론(reasoning), 코딩, 에이전트적 행동을 가르치는 후속 훈련 단계가 엄청난 계산 능력을 요구한다는 의미이며, 단순히 측면에서 토큰 파인튜닝을 하는 것을 의미하지 않습니다. 이는 논리 모델 시대가 가르쳐준 것과 같은 교훈입니다: 지도 학습 사전 훈련(supervised pretraining)은 유창함을 가져다주지만, 대규모 RL은 신뢰성을 가져다줍니다. Reflection은 오픈 웨이트 경쟁이 이제 사전 훈련 규모가 아닌 후속 훈련 계산 능력으로 결정될 것이라고 베팅하고 있습니다.
3. 사전 훈련 규모: 23.8조 토큰
23.8조 토큰은 전체 파라미터 대비 약 48토큰 수준으로, 업계가 수렴한 컴퓨트 최적(compute-optimal) 사전 훈련 비율 범위에 속합니다. 이는 오픈 모델이 거쳐 온 가장 밀도 높은 지식 로딩 단계이며, 라우터(router)가 선택할 수 있는 501B 규모의 전문가(specialists)를 가능하게 하는 기반입니다.
4. 1M 토큰 컨텍스트와 그 비용
백만 토큰 창(window)은 이제 최첨단 모델(frontier models)에게는 기본 사양(table stakes)이 되었지만, 창고의 수학적 원리를 기억해야 합니다. 컨텍스트는 메모리이고, 메모리는 MoE 서빙에서 희소 자원입니다. 1M 창은 헤드라인일 뿐이며, 실제로 중요한 수치는 데이터센터 없이 해당 창을 '서빙(serve)'할 수 있는 능력입니다.
SOTA: Beam의 리더보드 위치
| 모델 | 전체 / 활성 파라미터 | 컨텍스트 | 상태 |
|---|---|---|---|
| Beam (Reflection AI) | 501B / 23B | 1M | 10월 5일 발표; 가중치(weights)는 10월 말, Apache 2.0 |
| ... | |||
![]() |
Reflection은 "추론 컴퓨트(inference compute)를 3~4배 적게 사용한다"고 주장합니다. 활성 파라미터 산술(40/23 ≈ 1.7배)이 일부를 설명하지만, 나머지는 아키텍처와 서빙 스택에서 나와야 하며, 이 주장은 여전히 자체 보고(self-reported)입니다.
명확히 알아야 할 세 가지 사항:
수치는 회사에서 보고한 것입니다. TechCrunch는 성능 주장이 독립적으로 검증되지 않았다고 지적합니다. Beam은 고급 추론(advanced reasoning)에서 GLM-5.2와 비슷한 점수를 기록하고 네 가지 코딩 테스트에서 Inkling을 능가한다고 보도되었지만, 가중치가 아직 공개되지 않아 LMArena나 Artificial Analysis가 이를 확인할 수 없습니다. Moonshot의 Kimi K3는 순수 능력 면에서 여전히 Beam보다 우수한 것으로 알려져 있습니다. 독립적인 점수가 나올 때까지 리더보드는 잠정적인 것으로 간주하십시오.
효율성 논리가 진짜 이야기입니다. '추론 컴퓨팅(inference compute)이 3~4배 적다'는 것은 능력에 대한 주장이 아니라 비용에 대한 주장입니다. 만약 이 주장이 사실이라면, Beam은 중국 연구소 의존 없이 오픈 웨이트를 원하는 기업들의 핵심 작업마(workhorse)가 될 것이며 — Reflection이 'AI 공장'(자체 독점 데이터로 모델을 훈련하는 기관으로, 대한민국 신세계 그룹과 이미 국가 주권 AI 파트너십이 테스트되고 있음)에 던지는 제안은 토큰당 경제성이 대안들을 능가할 때만 의미가 있습니다. 헤지펀드와 트레이딩 회사들이 가장 먼저 줄을 서고 있다고 보고되었는데 — 이곳들은 추론 비용 자체가 전부인 분야입니다.
컴퓨팅 해자(compute moat)는 눈에 보입니다. Reflection은 2029년까지 SpaceX 및 Nebius와 엔비디아 GB300 접근권에 대해 70억 달러 이상의 계약을 체결했습니다. 이것이 '고성능 컴퓨팅 기반 강화학습(high-compute RL)'의 배경 인프라입니다. 오픈 웨이트 경쟁은 이제 컴퓨팅 조달 경쟁이 되었습니다.

중국 연구소들이 기준을 세웠고, 7월에는 Inkling이, 10월에는 Kolibri, Beam, Mistral Large 4가 등장했습니다. 미국과 유럽은 규모 자체가 아닌 효율성으로 응수하고 있습니다.
핵심 요약
핵심 요약
- 활성 파라미터(Active params)가 전체 크기가 아닌 추론 비용을 결정합니다. 501B 저장 / 23B 활성화 = 토큰당 46 GFLOPs — 밀집형 모델(dense-equivalent)은 21.8배 더 많은 컴퓨팅 자원을 소모할 것입니다.
- 저장 공간 자체는 여전히 전체 크기로 비용을 청구합니다. 약 501 GB의 FP8 가중치와 1M 컨텍스트에 대한 대용량 KV 캐시를 고려하면, 오픈 웨이트(open weights)가 운영하기에 저렴하지 않습니다.
- 경주는 이제 사후 학습 단계로 이동했습니다. '고성능 강화학습 (High-compute RL)'이 Reflection의 진정한 베팅입니다 — 추론 및 에이전트적 신뢰성은 사전 훈련되는 것이 아니라 학습됩니다.
- 효율성이 서구권의 해자(moat)입니다. Beam은 리더보드를 최상위로 차지하겠다고 주장하지 않습니다; GLM-5.2와 비교했을 때 추론 컴퓨팅 자원을 3~4배 적게 사용하며 동등한 성능을 낸다고 주장합니다. 만약 독립적인 벤치마크가 이를 확인한다면, 오픈 웨이트에 대한 논의는 '누가 가장 큰가'에서 '유용한 토큰당 누가 가장 저렴한가'로 전환될 것입니다.
- 10월 말에 검증됩니다. 가중치, 기술 보고서 및 모델 카드는 이달 중 Apache 2.0 라이선스로 공개될 예정입니다 — 그때 비로소 주장이 테스트 가능해집니다. 그전까지는: 잠정적입니다.
출처: Reflection AI 발표 및 TechCrunch (2026년 10월 5일); GLM-5.2 수치는 TechCrunch를 통해; Inkling (Thinking Machines Lab, 2026년 7월); aidailypost의 Kimi K3 비교; Kolibri 수치는 저희 10월 5일 게시물에서 가져옴; Mistral Large 4는 Reuters (2026년 10월 6일)를 통해.
다이어그램
동반 노트북: 본 포스트의 실행 가능한 튜토리얼 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
