Beam - Reflection의 5,010억 매개변수 오픈 웨이트 모델
요약
Beam이라는 5,010억 매개변수 오픈 웨이트 MoE 모델이 발표되었으나, 글쓴이는 이 모델의 성능과 공개 방식에 대해 회의적인 시각을 보입니다. 특히 과제 일반화 능력 검증 전제가 잘못되었다고 지적하며, 가중치와 기술 세부 정보가 부족한 현황을 비판합니다.
핵심 포인트
- Beam은 5,010억 개 매개변수의 MoE 모델로 코딩/추론에 특화됨.
- 글쓴이는 성능 우위 입증 방식과 과제 일반화 전제를 문제 삼음.
- 가중치와 기술 세부 정보 공개 없이 발표하는 것은 의미가 적다고 비판함.
- 오픈 웨이트 생태계 확장을 환영하나, 모델 간 경쟁 및 다양성 확보를 촉구함.
오픈 웨이트 모델이 늘어나는 건 반갑지만, 두 번째 데모 이미지 설명은 보고 멈칫했음. 경도 -179°~179°, 위도 -89°~89°를 180×90 격자, 총 16,200개 지점으로 나눠 육지와 바다를 구분하게 하고, Beam이 95.5%로 Opus 5의 92.5%와 Fable 5의 97.8% 사이에 들었다고 함. 그런데 “며칠 전에 나온 퍼즐이라 학습 데이터에 있을 수 없으므로 새로운 과제에 대한 일반화 능력을 검증한다”는 전제가 잘못됨.
최근 소셜미디어에서 유행했을 수는 있어도, 이런 방식으로 세계 지도를 생성하게 하는 과제는 적어도 2025년 8월 LessWrong에 이미 등장했음. https://www.lesswrong.com/posts/xwdRzJxyqFqgXTWbH/how-does-a....
원래 글이 올라왔을 때가 기억나며, 최근 과제가 아닌 건 확실함. 다만 이 과제 자체를 강화학습으로 훈련한 건 아니라는 취지는 여전히 유효하다고 봄.
소개에 따르면 Beam은 코딩·추론·에이전트 작업용 희소 전문가 혼합(MoE) 모델로, 전체 5,010억 개·활성 230억 개 매개변수를 사용함. 웹과 독점적으로 라이선스한 데이터셋의 23.8조 토큰으로 사전학습했고, 비슷한 규모의 공개 기반 모델과 동등하거나 더 우수하다고 함.
강화학습에는 NVIDIA GB300 GPU 10,500개를 4주간 사용해 1억 회 이상의 롤아웃을 생성했다고 하지만, 정작 지금은 사전 체험 안내뿐임. 가중치도 기술 세부 정보도 없고, 정보를 받으려면 등록하라는 것뿐임.
공개 모델이 늘어나는 건 환영하지만, 가중치와 Hugging Face 저장소도 없이 말만 하는 발표는 별 의미가 없음. 뒷받침할 자료를 공개하거나, 그전까지는 조용히 있는 편이 낫겠음.
독점 데이터셋이라는 표현도 의심스러움. 공개하고 싶지 않다는 뜻일 뿐일 수도 있고, 보유해서는 안 되는 데이터이거나 별다를 것 없는 학습 데이터를 무슨 비밀 재료처럼 포장하는 것일 수도 있음.
DeepSeek V4.1 Flash보다 크고, 실행 비용도 더 들며, 측정한 모든 지표에서 성능이 떨어지는 것으로 보임. 내가 놓친 게 있을까?
“서구 오픈 웨이트 모델의 최전선을 확장한다”는 문구를 보면, 중국 연구소가 아니라는 사실이 핵심 판매 포인트 중 하나임.
개인에게는 별 의미가 없을 듯하지만, 외국 모델 사용을 금지하는 정부 계약을 맺은 곳에는 의미가 있을 수 있음.
아직은 새로운 참여자라면 누구든 환영할 단계라고 봄. 첫 출시부터 최고 기록을 깰 필요는 없음.
좋은 모델을 만드는 데는 인터넷의 모든 것을 복사하는 것 이상의 무언가가 필요한 모양임.
이 규모의 모델 시장에 새로 진입한 미국 연구소라는 차이가 있음.
기존의 더 작은 무료 중국 모델보다 크면서 성능도 떨어지는 건가? 오픈 웨이트 모델은 반갑지만, 중국 기업들이 연구 결과를 많이 공개하는데도 서구 모델이 중국 모델에 크게 뒤처진 듯함. 경쟁 없이 중국이나 미국 모델에만 묶이는 건 위험하니, 공개 모델과 제공업체가 더 늘어나길 바람.
Google은 Gemma를 잘 만들고 있음. 실제로 언어를 잘 다루는 몇 안 되는 언어 모델 중 하나임. OpenAI의 최상위 비공개 모델조차 노르웨이어를 제대로 쓰지 못함.
검색 최적화만 생각해도 다음 모델 이름을 Workhorse로 지을 만함. 말이 실제 노동을 거의 하지 않게 된 지 오래인데, 업계가 하필 이 표현으로 수렴한 게 흥미로움.
사전학습 첫날 현장에서 학습 작업 시작을 모니터링하는 데 참여했음. 첫날부터 이 모델이 학습되는 과정을 지켜본 건 정말 멋진 경험이었음!
성능 차트에서 더 우수한 공개 모델을 처음 보이는 영역 밖으로 밀어내 Beam이 앞서는 것처럼 보이게 했지만, 실제로는 그렇지 않음. 공개 모델은 환영하지만 이번 발표는 오해를 유도함.
링크를 보고 오히려 DeepSeek V4.1 Flash를 살펴봐야겠다는 생각만 들었음.
기술에 아주 밝지는 않은데, 주권 문제를 제외하면 이 모델이 중국 공개 모델보다 나은 이유가 무엇인지 알려줄 수 있을까?
실행 가능한 하드웨어와 성능 특성이 궁금함. 추론 속도 최적화가 작은 하드웨어에서 실행하는 데도 도움이 될 듯하지만, 반대로 매개변수 수에 비해 훨씬 많은 자원을 요구할 가능성도 있어 보임.
공개 모델이라면서 아직 가중치가 공개되지 않았고 API 접근도 제한적임. 주로 Inkling이나 GLM 5.2처럼 최고 성능이 아닌 모델과 비교함.
GLM 5.3과 DeepSeek V4.1 Flash는 표에는 넣고 차트에서는 뺐는데, 함께 그리면 성능이 뒤처져 보이기 때문인 듯함. AA Index나 Arena 결과도 없음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기