![[DSV4-0731] 3x3090+DDR5 환경에서 1MM 손실 없는 컨텍스트(lossless ctx), 300PP, 15TG 달성 대표 이미지](https://preview.redd.it/2ecwgst2bkhh1.png?width=140&height=73&auto=webp&s=2aa2e0ab417aaeba5f7402d863fce7259cf40aa0)
[DSV4-0731] 3x3090+DDR5 환경에서 1MM 손실 없는 컨텍스트(lossless ctx), 300PP, 15TG 달성
요약
3x3090 및 DDR5 환경에서 1MM 컨텍스트 손실 없이 300PP를 달성한 기술적 성과를 다룹니다. llama.cpp 커스텀 빌드와 MoE 전문가 오프로드 방식을 통해 대규모 컨텍스트 처리 성능을 최적화했습니다.
핵심 포인트
- 3x3090 환경에서 1MM 컨텍스트 손실 없는 구현
- llama.cpp 커스텀 빌드를 통한 DeepSeek4 아키텍처 지원
- MoE 전문가 오프로드 방식을 통한 메모리 효율화
- 64,000 토큰 기준 300PP 성능 달성
4번째 3090은 gemma 12b 및 flux2klein 확산 모델 (diffusion models)을 실행합니다. 저는 말로 입력하고 시각적 아티팩트(visual artifacts)가 포함된 HTML을 결과로 받습니다. Claude Code가 여기의 llama.cpp 빌드를 구축했습니다: llama.cpp 빌드 (DS4 spill launcher) - 트리: llama.cpp fork (deepseek4 아키텍처 지원 포함) ("ds4-next" + vektorprime/working_ds4_speed의 4개 CUDA prefill-speed 커밋) - 커밋: 9705ea4b3 (b10229-2, 버전 10231), 2026-08-03 - 빌드: cmake Release, GGML_CUDA=ON, CUDA_ARCHITECTURES=86 (RTX 3090), CUDA 12.8 (V12.8.93), GCC 13.3.0, FA 활성화, CUDA graphs 활성화 - MoE: 정밀한 -ot 전문가 오프로드 (late-layer FFN experts → CPU), --cpu-moe 방식이 아님. 콜드 스타트(Cold start) 시 15TG이며, 이후 안정적인 10 TG로 느려집니다. 300PP는 64,000 토큰 이후 100PP로 저하됩니다. vektorprime의 커밋들은 /u/Important_Quote_1180이 제출한 코드만 체리픽(cherry-picked)되었습니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기