
upstage/Solar-Open2-250B · Hugging Face
요약
Upstage가 에이전트 작업과 긴 컨텍스트 처리에 최적화된 250B MoE 모델인 Solar Open 2를 공개했습니다. 하이브리드 어텐션 아키텍처를 통해 대형 모델의 성능을 유지하면서도 소형 모델 수준의 효율적인 추론 비용을 제공합니다.
핵심 포인트
- 에이전트 워크플로우(도구 호출, 다단계 추론)에 특화된 설계
- 하이브리드 어텐션 MoE 구조로 추론 비용 최소화
- 1M 토큰의 긴 컨텍스트를 효율적으로 처리하는 메모리 구조
- 영어, 한국어, 일본어를 지원하는 다국어 모델
Solar Open 2는 사무 생산성, 문서 집약적 작업, 코딩과 같은 에이전트적 (agentic) 사용 사례를 위해 구축된 Upstage의 250B-A15B 오픈 웨이트 (open-weight) 대규모 언어 모델 (LLM)입니다. 선형 어텐션 (linear attention)을 결합한 하이브리드 어텐션 전문가 혼합 (Hybrid-Attention Mixture-of-Experts (MoE)) 아키텍처는 긴 컨텍스트 (long-context) 설정에서도 매우 효율적인 추론을 제공합니다.
에이전트 전문가 (Agentic Specialist): 도구 호출 (tool calling), 다단계 추론 (multi-step reasoning), 엔드 투 엔드 작업 실행과 같은 에이전트 워크플로우 (agentic workflows)를 위해 특화되어 설계되었습니다. 에이전트 벤치마크에서 가장 강력한 오픈 웨이트 모델들과 경쟁할 수 있는 수준입니다.
최소한의 추론 비용 (Minimal Inference Cost): 토큰당 15B만 활성화되는 250B 파라미터 MoE로, 세 개의 선형 어텐션 (linear-attention) 레이어와 하나의 소프트맥스 어텐션 (softmax-attention) 레이어를 교차 배치한 하이브리드 어텐션 스택을 기반으로 구축되었습니다. 즉, 소형 모델의 추론 비용으로 대형 모델의 용량을 제공합니다.
1M-토큰 컨텍스트 (1M-Token Context): 선형 어텐션 레이어는 순환 상태 (recurrent state)에 토큰 순서를 본질적으로 인코딩하므로, 위치 인코딩 (positional encoding)이 완전히 제거되어 (NoPE), RoPE 외삽 (extrapolation) 한계를 극복합니다. 48개의 레이어 중 12개 레이어만이 KV 캐시 (KV cache)를 유지하여, 동일한 크기의 전체 소프트맥스 모델 대비 약 4분의 1 수준으로 긴 컨텍스트 메모리를 보유합니다.
저비용의 효율적인 학습 (Efficiently Trained at Low Cost): Solar Open 1 (102B)로부터 선택적 가중치 전이 (selective weight transfer)를 통해 초기화되었습니다. 아키텍처 변경 과정에서 살아남은 가중치의 2.3%만이 전달되고 나머지는 무작위로 초기화되었으나, 이는 시작점을 높여 250B 규모에서의 초기 수렴을 가속화합니다.
다국어 지원 (Multilingual): 영어, 한국어, 일본어.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기