Qwen3.8 27b 모델의 200K 컨텍스트 및 MTP 적용 결과 (12GB Ampere 카드 기준)
요약
본 글은 3090 사용자 개선을 지속하는 LlamAmpere의 최신 버전을 소개하며, 특히 12GB VRAM 카드 사용자를 위한 다양한 런타임 개선 사항에 초점을 맞추고 있습니다. KVaRN 변형 추가와 압축 MTP 캐시 등을 통해 컨텍스트 길이 확장 및 성능 향상을 달성했습니다.
핵심 포인트
- 12GB VRAM 사용자에게 최적화된 LlamAmpere 업데이트가 제공됩니다.
- KVaRN의 새로운 변형(Staged + Journaled KVaRN)을 추가하여 성능과 효율성을 높였습니다.
- 최대 230k 컨텍스트 길이를 지원하며, BF16 성능의 85%를 유지했습니다.
- 표준 에이전트 작업에 사용 가능한 수준으로 코딩 평가 및 테스트를 거쳤습니다.
안녕하세요 여러분! 지난번 LlamAmpere를 게시했을 때 피드백과 메모를 제공해 주신 모든 분들께 감사드립니다. 저는 여전히 3090 사용자들을 위한 개선 작업을 계속하고 있습니다. 이번 버전은 성능이 소폭 향상되었고(34%), 실행 시간도 수백 MB가 줄었습니다(YaRN을 사용하는 경우 최대 약 340K 컨텍스트를 지원할 수 있게 되었습니다). 하지만, 이 업데이트는 이전 두 번의 배포에서 초점이 아니었던 12GB 카드 사용자들에게 주로 맞춰져 있습니다. 구성 가능한 다양한 런타임 개선 및 조정(압축 MTP 캐시, 16비트 활성화 값, 중복 오버헤드 항목 제거) 외에도, KVaRN의 새로운 변형(Staged + Journaled KVaRN)을 추가했습니다. 이로 인해 논문과 비교하여 충실하고 경쟁력 있는 버전 대비 KLD가 약 40% 감소했습니다. 대용량 카드의 경우, 제가 새롭게 권장하는 기본값은 4/4입니다 (8/4 KV 캐시보다 훨씬 좋은 성능). 하지만 최대 컨텍스트를 얻고자 하는 분들에게는 여전히 3/3 비트(0.001 nats KLD)와 3/2 비트(0.0024 nats)가 매우 견고합니다 (3/2의 KLD는 4 XL에서 4 S 양자화로 전환할 때 보이는 성능 저하보다 작습니다). 테스트된 모델은 각각 11GB에서 205k230k 컨텍스트 길이를 지원하며, 이는 헤드리스(headless) 구성으로 GPU를 100% 사용하는 경우 훨씬 더 많은 용량입니다. 테스트에 사용된 모델은 swift-1.5-uncensored와 mirai의 2.5 bpw 모델을 2.3bpw로 융합한 것입니다. 이 모델은 3060/80/ti 카드에서 7회 실행된 LiveCode Bench에서 BF16 성능의 85%를 유지했습니다. 3080/ti에서는 MTP 덕분에 평가(evals) 시 평균 약 65~70 tps를 기록했습니다. 이 모델이 손실 없는(lossless) 것은 절대 아니며, 특정 다른 모델처럼 완벽하다고 주장하지는 않겠습니다. 하지만 개인적으로 hermes에서 며칠 동안 사용해보고 코딩 평가와 pi 테스트를 거쳐보니, 표준 에이전트 작업에는 진정으로 사용할 수 있는 수준입니다. 주관적으로 볼 때, 컨텍스트가 12GB에 맞는 모델치고는 매우 좋은 성능으로, qwen3.5 및 3.6의 BF16 버전 사이 어딘가에 위치한다고 생각합니다.
LlamAmpere는 이전과 같이 MIT 라이선스입니다: https://github.com/JakeATX/llamAmpere Models (4 XS-M, 2.3bpw 등)은 swift 1.5 기반으로 여기 있습니다: https://huggingface.co/collections/jakeatx/qwen38-27b-models (만약 선호하신다면 llamAmpere는 EXL도 지원하지만, 저는 prefill + decode 커널 개선 작업을 진행 중이라 아직 3~5 bpw 범위에서 완벽한 속도는 아닙니다) 이전과 같이 여러분의 결과나 버그 등을 공유해 주십시오. 백로그에 추가될 것입니다. 즐거운 시간 되세요! /u/Brief-Tap-6616이 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기