
joerowell의 Laguna XS.2 및 M.1 지원 추가 · Pull Request #25165 · ggml-org/llama.cpp
요약
llama.cpp 프로젝트에 Laguna XS.2 및 M.1 모델 지원이 추가되었습니다. Laguna 시리즈는 에이전트 기반 코딩과 장기 작업을 위해 설계된 MoE(Mixture-of-Experts) 모델입니다.
핵심 포인트
- Laguna XS.2는 33B 파라미터 규모의 MoE 모델입니다.
- Laguna M.1은 225B 파라미터 규모의 대형 MoE 모델입니다.
- 에이전트 기반 코딩 및 장기 작업 수행에 최적화되었습니다.
- GQA 및 슬라이딩 윈도우 주의 집중 기술을 사용합니다.
https://huggingface.co/poolside/Laguna-S-2.1-GGUF https://huggingface.co/unsloth/Laguna-S-2.1-GGUF https://huggingface.co/poolside/Laguna-S-2.1 Laguna S 2.1은 토큰당 8B의 활성화 파라미터(activated parameters)를 가진 총 118B 파라미터의 Mixture-of-Experts (MoE) 모델로, 에이전트 기반 코딩(agentic coding) 및 장기 작업(long-horizon work)을 위해 설계되었습니다. 이 모델은 Laguna 시리즈 내에서 Laguna XS 2.1 (33B-A3B)과 Laguna M.1 (225B-A23B) 사이에 위치하며, 다음과 같은 패밀리 레시피를 공유합니다: 256개의 라우팅된 전문가(routed experts)와 하나의 공유 전문가(shared expert)에 대해 softplus 게이팅(gating)을 사용하는 토큰 선택 라우터(token-choice router), 그룹화된 쿼리 주의 집중(Grouped-Query Attention, GQA), 그리고 인터리브된 전체/슬라이딩 윈도우 주의 집중(interleaved full/sliding-window attention). https://huggingface.co/poolside/Laguna-XS.2 Laguna XS.2는 로컬 머신에서의 에이전트 기반 코딩(agentic coding) 및 장기 작업(long-horizon work)을 위해 설계된, 토큰당 3B의 활성화 파라미터(activated parameters)를 가진 총 33B 파라미터의 Mixture-of-Experts (MoE) 모델입니다. 빠른 추론(inference)과 낮은 KV 캐시(KV cache) 요구 사항을 위해 40개 레이어 중 30개 레이어에서 헤드별 게이팅(per-head gating)을 사용하는 슬라이딩 윈도우 주의 집중(Sliding Window Attention)을 사용합니다. https://huggingface.co/poolside/Laguna-M.1 Laguna M.1은 에이전트 기반 코딩(agentic coding) 및 장기 작업(long-horizon work)을 위해 설계된, 토큰당 23B의 활성화 파라미터(activated parameters)를 가진 총 225B 파라미터의 Mixture-of-Experts (MoE) 모델입니다. /u/jacek2023에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기