Laguna-S-2.1이 나의 6년 된 게이밍 PC에서 돌아갑니다!
요약
Laguna-S-2.1 모델을 RTX 3080 기반의 구형 게이밍 PC 환경에서 구동한 사례를 공유합니다. VRAM과 RAM 사용량이 매우 높지만, 특정 설정(IQ4_XS, 128k 컨텍스트)을 통해 실사용 가능한 수준의 성능을 확인했습니다.
핵심 포인트
- RTX 3080 및 Ryzen 9 3950X 환경에서 구동 성공
- 128k 컨텍스트 사용 시 VRAM 8.3GB, 호스트 RAM 52.2GB 점유
- Prefill 120 t/s, Decode 10 t/s의 성능 기록
- llama.cpp 및 GGUF 형식을 활용한 최적화 시도
Laguna-S-2.1이 나의 2020년형 PC (RTX 3080 10GB, Ryzen 9 3950X, 64 GB RAM)에서 돌아갑니다. 현실적으로는 밤새도록 실행할 때만 사용 가능합니다. 숨을 너무 크게 쉬기라도 하면 VRAM과 호스트 RAM(host RAM)이 모두 바닥나 버립니다. 제가 어떤 코딩 프로젝트를 맡기더라도 컴파일(compilation)과 유닛 테스트(unit tests)를 실행할 수 있을 만큼의 RAM만 겨우 남아 있습니다. IQ4_XS, 128k q8/q8 컨텍스트(context), 모든 덴스 텐서(dense tensors)를 VRAM에 배치, DFlash 미사용 (용량이 부족함). Prefill 120 t/s, Decode 10 t/s, VRAM 8.3 GB, 호스트 RAM 52.2 GB. 아직 철저하게 테스트해보지는 않았지만, 바로 사용 가능한 수준으로 작동하는 것 같습니다. beellama에 지원이 추가되어 (한 달 뒤쯤?) kvarn으로 전환할 수 있게 되면, VRAM 압박이 훨씬 관리하기 쉬워질 것입니다 (그러길 바랍니다. kvarn은 Gemma와 작동하지 않습니다; 이 모델에 대해서는 모릅니다). llamacpp CUDA @ https://github.com/poolsideai/llama.cpp/pull/3 hf = unsloth/Laguna-S-2.1-GGUF:UD-IQ4_XS ngl = 99 n-cpu-moe = 99 ctx-size = 131072 jinja = true flash-attn = on cache-type-k = q8_0 cache-type-v = q8_0 mlock = true no-mmap = true submitted by /u/crusaderky [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기