
총 파라미터 118B, 활성 파라미터 8B인 Laguna S 2.1이 어떻게 자신보다 10배 큰 모델들을 이기는가
요약
Poolside가 MoE 아키텍처를 활용한 Laguna S 2.1 모델을 출시했습니다. 총 118B 파라미터를 보유했으나 활성 파라미터는 8B에 불과하여, 효율적인 추론 비용으로 대규모 모델들을 능가하는 성능을 보여줍니다.
핵심 포인트
- MoE 아키텍처를 통해 8B 활성 파라미터로 대형 모델 대비 높은 벤치마크 성능 달성
- Terminal Bench 및 SWE bench 등 주요 벤치마크에서 Nemotron 및 DeepSeek 모델 상회
- 1M 컨텍스트 윈도우 지원을 위한 슬라이딩 윈도우 어텐션 설계 적용
- 네이티브 추론 기능 및 상업적 이용 가능한 OpenMDW 1.1 라이선스 채택
Poolside가 오늘 조용히 Laguna S 2.1을 출시했는데, 이 서브레딧(sub)에서 이에 대해 충분히 이야기되지 않았다고 생각합니다. 핵심 수치는 이렇습니다: 총 파라미터(total parameters)는 118B이지만, 토큰당 활성(activated) 파라미터는 약 8B에 불과합니다. 256개의 라우팅된 전문가(routed experts)와 하나의 공유 전문가(shared expert)를 가진 전문가 혼합(Mixture of Experts, MoE) 아키텍처입니다. 실제로 이는 활성 파라미터 수로 예상되는 것보다 훨씬 뛰어난 품질을 얻으면서도, 추론 비용(inference costs)은 8B 밀집(dense) 모델에 가깝게 유지할 수 있음을 의미합니다.
벤치마크 표에서 흥미로운 점은 다음과 같습니다. Nemotron 3 Ultra가 55B의 활성 파라미터를 가진 550B 모델임에도 불구하고, Laguna S는 거의 모든 면에서 이를 능가합니다. Terminal Bench 2.1에서 Laguna S는 70.2%를 기록한 반면, Nemotron은 56.4%를 기록했습니다. SWE bench Multilingual에서는 78.5% 대 67.7%로 앞섭니다. 이는 정말 말도 안 되는 수준의 최적화(optimization)입니다. 또한 SWE bench Multilingual(78.5% 대 76.2%)과 SWE Bench Pro(59.4% 대 55.4%)에서 DeepSeek V4 Pro Max를 이깁니다. DeepSeek V4 Pro Max는 49B의 활성 파라미터를 가진 1.6조(trillion) 파라미터 모델입니다. Laguna S는 활성 파라미터가 8B뿐입니다.
생각해 보세요. 총 파라미터가 975B인 Inkling이 Terminal Bench(70.2% 대 63.8%)와 SWE Bench Pro(59.4% 대 54.3%)에서 패배합니다. 거의 1조 파라미터에 달하는 모델이 이론적으로 직접 호스팅(self host)할 수 있는 모델에게 지는 것입니다.
패배하는 부분에 대한 솔직한 모습은 다음과 같습니다: Kimi K3와 Claude Fable 5는 여전히 최상위 벤치마크에서 확실히 앞서 있으며, Muse Spark 1.1은 Toolathlon Verified에서 Laguna S를 꽤 여유 있게 이깁니다. 따라서 이것이 모든 분야의 새로운 왕은 아닙니다. 하지만 그럼에도 불구하고 매우 훌륭한 모델입니다.
주의 깊게 볼 만한 다른 몇 가지 사항:
1M 컨텍스트 윈도우(context window). 단순한 마케팅용 숫자가 아닙니다. 아키텍처가 인터리브된 전체 및 슬라이딩 윈도우 어텐션(interleaved full and sliding window attention), 12개의 글로벌 레이어(global layers) 및 36개의 슬라이딩 윈도우 레이어(sliding window layers)를 통해 이를 실제로 지원합니다. 이는 단순한 마케팅 주장이 아닌 롱 컨텍스트(long context) 설계입니다. 도구 호출(tool calls) 사이에 인터리브된 사고(thinking)를 포함하는 네이티브 추론(Native reasoning) 기능도 있습니다. 모든 작업에 오버헤드(overhead)가 필요한 것은 아니기에, 요청(request)마다 이를 토글(toggle)할 수 있도록 한 것은 올바른 결정입니다. OpenMDW 1.1 라이선스를 따르므로 상업적 이용이 가능합니다. 이것으로 무언가를 구축하려는 분들에게는 매우 중요한 부분입니다.
lyzr control plane과 같은 하네스 (harness)를 추가하면 8B의 활성 파라미터 (active parameter)는 상당히 다루기 쉬운 수준이 됩니다. 하드웨어 측면에서는: BF16 가중치 (weights)는 약 236GB가 필요하므로, 전체 모델을 구동하려면 멀티 GPU (multi GPU) 환경을 고려해야 합니다. Q4 GGUF 버전도 제공되어 요구 사양을 대폭 낮출 수 있습니다. MoE (Mixture-of-Experts) 아키텍처를 고려할 때, 메모리 요구 사항은 118B 밀집 모델 (dense model)보다 훨씬 관리하기 쉬운데, 이는 특정 시점에 활성 전문가 가중치 (active expert weights)만 로드되어 있으면 되기 때문입니다. 세상에, 이번 달은 정말 풍족하네요. 첫 번째는 glm5.2였고 이제는 sam altman이 잠을 못 자고 있겠군요 ㅋㅋ submitted by /u/UsedMorning9886 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기