Meta가 Llama 4 Scout를 출시하다: 네이티브 Mixture-of-Depths 아키텍처 기반의 개방형 모델
요약
Meta가 동적 Mixture-of-Depths (MoD) 아키텍처를 기반으로 한 오픈 소스 파운데이션 모델 Llama 4 Scout를 출시했습니다. 이 모델은 총 1050억 개의 매개변수를 가지며, 토큰당 활성 매개변수는 240억 개로 효율적입니다. MoD는 컴퓨팅을 동적으로 할당하여 추론 지연 시간을 크게 줄였으며, 네이티브 1M 토큰 컨텍스트와 높은 검색 정확도를 자랑합니다.
핵심 포인트
- MoD 아키텍처를 통해 FLOPs 병목 현상을 해결하고 효율성을 극대화했습니다.
- 총 1050억 개 매개변수 대비 토큰당 활성 매개변수는 240억 개로 매우 효율적입니다.
- 네이티브 1M 컨텍스트 창을 지원하며, 검색 정확도(NIAH)가 높습니다.
- SWE-bench Verified에서 48.6%의 이슈를 자율 해결하는 등 강력한 코딩 능력을 보여줍니다.
Meta의 Fundamental AI Research (FAIR) 팀은 동적 Mixture-of-Depths (MoD) 라우팅을 기반으로 구축된, 오픈 소스 커뮤니티 최초의 프론티어급(frontier-class) 파운데이션 모델인 Llama 4 Scout를 공식 출시했습니다. 총 매개변수 용량은 1050억 개이며 토큰당 활성 매개변수는 240억 개에 불과하지만, Llama 4 Scout는 합성 코딩, 수학, 장문맥 합성 벤치마크에서 선도적인 클로즈드 소스 추론 엔진과 동등한 성능을 달성하며 엔터프라이즈급 듀얼 GPU 워크스테이션에서도 효율적으로 작동합니다.
Mixture-of-Depths (MoD)가 FLOPs 병목 현상을 해결하는 방법
표준 밀집(dense) 트랜스포머 아키텍처는 모든 토큰에 동일한 컴퓨팅 예산을 사용하며, 구두점이나 일상적인 채움 단어(filler words)를 복잡한 수학적 증명이나 다형성 코드 논리와 정확히 같은 80개 레이어 깊이로 평가합니다. Llama 4 Scout는 각 트랜스포머 블록에 통합된 학습된 top-k 라우팅 게이트를 통해 이러한 균일한 할당을 포기했습니다.
추론(inference) 과정에서, 라우터는 토큰 복잡성을 평가하고 컴퓨팅을 동적으로 할당합니다. 단순한 토큰은 깊은 self-attention 및 feed-forward 레이어를 우회 경로(residual shortcut paths)를 통해 건너뛰고, 정보량이 많은 토큰은 전문화된 추론 블록 전반에 걸쳐 최대의 컴퓨팅 자원을 받습니다. 이러한 동적 깊이 할당은 밀집 70B 모델 대비 생성 지연 시간(generation latency)을 58% 감소시키는 동시에 전체 모델 용량을 1050억 개 매개변수로 확장합니다.
Llama 4 Scout 아키텍처 하이라이트
- 총/활성 매개변수: 총 1050억 개의 매개변수; 토큰당 240억 개의 활성 매개변수.
네이티브 컨텍스트 창: 로프(rope) 주파수 저하 없이 네이티브로 1,000,000 토큰 (1M) 지원.
...
제로 니들 검색 손실을 가진 네이티브 1M-토큰 컨텍스트 창
이전의 개방형 가중치(open-weights) 모델들이 수십만 토큰 지원을 주장할 때, 종종 사후 훈련 RoPE 보간법(예: YaRN)에 의존했으며, 이는 64K 토큰을 초과하면 급격한 perplexity 스파이크와 'lost-in-the-middle' 검색 성능 저하를 야기했습니다. Llama 4 Scout는 8단계의 점진적 컨텍스트 확장 커리큘럼(progressive context expansion curriculum)을 거쳐 최대 1,048,576 토큰까지 사전 훈련 단계 제로(pre-training step zero)부터 훈련되었습니다.
전체 1M 토큰 스펙트럼에 걸친 업계 표준인 Needle In A Haystack (NIAH) 벤치마크에서 Llama 4 Scout는 2,500개의 서로 다른 문서 깊이(document depths) 전반에 걸쳐 99.8%의 검색 정확도를 달성했습니다. 이 모델은 단일 프롬프트 실행만으로 다권 분량의 법률 디스커버리 코퍼스, 전체 풀스택 소프트웨어 저장소, 광범위한 과학 문헌 컬렉션 등을 손쉽게 처리합니다.
벤치마크 분석: 까다로운 폐쇄형 프론티어 API
Meta는 독립적인 제3자 감사 팀이 수행한 포괄적인 벤치마크 평가 결과를 발표했습니다. SWE-bench Verified에서 Llama 4 Scout는 실제 GitHub 이슈의 48.6%를 자율적으로 해결하여, 완전한 자체 호스팅 자유도를 유지하면서도 독점 상업 리더들과 어깨를 나란히 할 수 있는 위치에 놓였습니다.
벤치마크
Llama 4 Scout (Open)
Claude 3.5 Sonnet
...
개방형 가중치 사용 가능성 및 생태계 배포
기반 모델(base), 명령어 튜닝 모델(instruction-tuned), 양자화된 변형(quantized variants)의 체크포인트가 Hugging Face Hub와 Meta 공식 모델 배포 포털에서 이용 가능해졌습니다. 네이티브 런타임 지원은 이미 vLLM, Ollama, LM Studio, 그리고 Hugging Face TGI에 통합되어, 개발자들이 기업 Kubernetes 클러스터 전반에 걸쳐 자체 호스팅 인스턴스를 즉시 배포할 수 있게 했습니다.
Meta는 토큰당 API 비용을 전혀 부과하지 않으면서 프론티어 수준의 멀티모달 이해력 및 장문 컨텍스트 추론 능력을 제공함으로써, 스타트업과 데이터 민감 조직에 모델 성능 저하 없이 완전한 데이터 주권(data sovereignty)을 부여하며 엔터프라이즈 AI 생태계를 계속해서 재편하고 있습니다.
기술 아키텍처, 모범 사례 및 실용적 구현 가이드라인
적절한 기술 도구와 구성 표준을 선택하는 것은 배포 복잡성과 운영 효율성 간의 균형을 맞추는 것을 요구합니다. 업계 표준 소프트웨어 엔지니어링 관행을 구현하면 다양한 하드웨어 환경에서 신뢰할 수 있는 실행, 확장 가능한 워크플로우, 지속 가능한 장기 성능을 보장할 수 있습니다.
핵심 구현 및 평가 체크리스트
- 효율성 및 리소스 오버헤드: 낮은 메모리 소비와 최소한의 백그라운드 프로세서 활용을 보장하기 위해 시스템 리소스 발자국(footprints)을 평가합니다.
다중 플랫폼 상호 운용성: 워크플로우를 표준화하기 전에 다양한 운영 체제 및 하드웨어 구성 전반에 걸쳐 호환성을 확인합니다.
...
핵심 시사점 및 최종 평가
검증된 아키텍처 표준, 깔끔한 구성(clean configurations), 그리고 체계적인 성능 벤치마킹을 우선순위에 두어 사용자 및 개발자는 불필요한 기술 부채를 피하면서 생산성을 극대화할 수 있습니다.
원문 출판: Tech Boss — 기술 뉴스, 사이버 보안 권고 및 시스템 엔지니어링 벤치마크 제공.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기