Agens Volundr 32B Preview 공개: 자체 하이브리드 아키텍처를 적용한 소규모 팀의 첫 모델
요약
소규모 팀 Blockway가 자체 하이브리드 아키텍처를 적용한 32B 모델 'Agens Volundr'를 공개했습니다. 이 모델은 KV 캐시 의존도를 낮추고, 압축-희소 어텐션 및 Engram 같은 독자적 구조를 활용하여 긴 컨텍스트(262K)에서도 높은 처리량을 보여줍니다. 특히 단일 사용자 환경에서 뛰어난 속도와 벤치마크 성능을 입증했습니다.
핵심 포인트
- KV 캐시 의존도를 낮춘 하이브리드 아키텍처 적용
- 압축-희소 어텐션 및 Engram 메모리를 활용한 구조 설계
- 262K의 긴 컨텍스트 창과 높은 처리량(tok/s) 달성
- LiveCodeBench, HumanEval 등 코딩 벤치마크에서 우수한 성능 입증
안녕하세요 r/LocalLLaMA 커뮤니티 여러분. 저는 홍콩에 위치한 소규모 팀 Blockway의 일원입니다 (공개 고지: 이 모델은 저희가 개발했습니다). 오늘 저희는 자체 하이브리드 아키텍처를 기반으로 구축된 첫 번째 모델인 Agens Volundr 32B Preview를 공개합니다. 제한적인 컴퓨팅 자원으로 학습되었기 때문에 완벽하지 않으며, 어떤 부분에서 부족한지 미리 말씀드리는 것이 좋다고 생각했습니다.
왜 이 모델을 만들었는가
저희 고객들은 자체 장비에서 모델을 구동합니다. 컨텍스트 길이가 길어질수록 가중치(weights)보다는 KV 캐시(KV cache)가 무엇이 적합한지를 결정합니다. 그래서 저희는 대부분의 레이어가 KV 캐시를 유지하지 않도록 설계된 모델을 만들었습니다.
아키텍처 (72개 레이어, 밀도 약 32B, 모든 레이어에서 모든 토큰 실행)
- 54개의 KDA (Kimi Delta Attention) 레이어: 고정 크기 재귀 상태를 가진 선형 어텐션(linear attention), KV 캐시 없음
- 17개의 BCSA 레이어 (저희의 압축-희소 어텐션, compressed-sparse attention): 마지막 4,096개 토큰에 대한 정확한 창(window); 이전 컨텍스트는 블록 단위로 4:1 풀링되고 학습된 인덱서가 상위 512개 블록을 읽습니다.
- 1개의 완전 어텐션 레이어 (레이어 72)
- Engram: 호스트 RAM에 저장되는 해시 n-gram 메모리로, 72개 레이어 중 2곳에 부착됨
- mHC: 기존의 1개 대신 4개의 잔여 스트림(residual streams)을 사용합니다.
따라서 72개 레이어 중 단 18개 레이어만이 KV 캐시를 유지합니다. 컨텍스트 창 크기는 262K입니다.
속도 (단일 사용자, 저희의 sglang 빌드)
- BF16을 두 개의 48 GB GPU에서 사용했을 때:
- 디코드(decode): 1K에서 25.1 tok/s, 8K에서 24.1 tok/s, 32K에서 24.1 tok/s, 64K에서 24.0 tok/s, 128K에서 23.9 tok/s
- BF16 프리필(prefill): 1K부터 128K까지 2,122 / 2,180 / 1,916 / 1,679 / 1,297 tok/s
- INT4 (31.7 GiB)를 하나의 48 GB GPU에서 사용했을 때:
- 디코드(decode): 1K에서 31.0 tok/s, 8K에서 29.3 tok/s, 32K에서 29.1 tok/s
- 총 처리량 (Aggregate throughput):
- 사용자 8명일 때: BF16으로 127 tok/s, INT4로 117 tok/s
- 사용자 16명일 때: BF16으로 130 tok/s
DFlash2 drafter (별도 저장소), 단일 사용자, 서버에 적용 여부에 따른 비교:
JSON/툴 출력의 경우 최대 3.6배 향상, 코드의 경우 2.0배 향상, 사고(thinking) 모드에서는 약 1.6배 향상되었습니다. 다만, 동시 사용자가 대략 8명을 초과하면 그 이상의 이점은 없습니다.
벤치마크 (BENCHMARKS) (모든 테스트는 동일한 설정과 비교 모델을 사용하여 당사에서 진행함; 전체 표와 각주는 모델 카드 참조)
LiveCodeBench v6 (+4.2), HumanEval (+4.3), AIME 2025 (+2.9), MATH-500 (+1.6) 등 Qwen3.8-27B보다 앞섬
MMLU-Pro, IFEval, GPQA Diamond에서는 대략 비슷한 수준임
에이전트 작업(agent tasks)에서는 뒤처짐: tau2-bench 74.2 vs 79-80, SWE-bench Verified (50개 태스크 하위 집합) 44 vs 58-64. 이 격차를 줄이는 것이 전체 v1의 주요 초점이며, 이는 약 10B 토큰까지 추가 사전 학습을 진행하고 장기 에이전트 세션에 대한 학습을 추가할 예정임.
알려진 한계점 (KNOWN LIMITATIONS) (시도하기 전에 읽어주세요)
당사의 sglang 빌드가 필요함. 기본(Stock) sglang과 vLLM으로는 아직 로드할 수 없음.
GGUF / llama.cpp는 계획 중이며, 오늘 제공되지 않음.
장기 에이전트 세션은 이번 프리뷰에서 가장 약한 부분임.
아직 학습 중인 모델이므로, 최종 모델이 아닌 프리뷰로 간주해 주세요.
사용 방법 (RUN IT)
docker pull ghcr.io/blockwayz/agens-sglang:preview-sm89 (48 GB Ada GPU)
docker pull ghcr.io/blockwayz/agens-sglang:preview-sm90 (H100 / H200)
전체 실행 명령어는 모델 카드에 있음.
링크 (LINKS)
BF16: https://huggingface.co/Blockway/Agens-Volundr-32B-Preview
INT4: https://huggingface.co/Blockway/Agens-Volundr-32B-Preview-INT4
DFlash2 drafter: https://huggingface.co/Blockway/Agens-Volundr-32B-Preview-DFlash2
프로젝트 페이지: https://github.com/BlockWayz/Agens-Volundr
서빙 코드: https://github.com/BlockWayz/agens-sglang
Apache-2.0. 저희는 소규모 팀이며, 여러분이 할 수 있는 가장 유용한 일은 직접 사용해 보고 어디에서 문제가 발생하는지 알려주는 것입니다: 이슈(issue), 실패하는 프롬프트, 테스트를 요청하고 싶은 벤치마크 등. 댓글에 답변드리겠습니다.
제출자: /u/ComfortableKindly507
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기