Strata 0.1.40.1 버전에서 4개 GPU 시스템의 사용되지 않는 VRAM 약 10GB가 발견됨
요약
Strata 엔진을 v0.1.40.1으로 업데이트한 후, 여러 GPU 시스템에서 약 10GB에 달하는 사용되지 않는 VRAM이 발견되었습니다. 이는 버그가 아니라, 모델의 '콜드(cold)' 전문가를 제거하여 메모리 효율성을 높인 결과입니다. 이로 인해 상주 전문가 수가 감소했지만, 캐시 적중률 변화 없이 실제 생성 속도는 향상되는 등 성능 개선 효과를 가져왔습니다.
핵심 포인트
- v0.1.40.1 업데이트 후 약 10GB의 여유 VRAM이 발견됨.
- VRAM 여유 공간은 '콜드' 전문가 제거로 인한 메모리 최적화 결과임.
- 상주 전문가 감소에도 불구하고 실제 생성 속도(Gen tok/s)가 향상됨.
- 불필요한 콜드 전문가는 캐싱할 가치가 낮아 성능에 기여하지 않음.
다양한 구성의 시스템(RTX 5060 Ti + 3090 + 2x 3060)에 Strata 엔진을 사용하여 Qwen3.8 Flash-Next (125B MoE, IQ3_XXS) 모델을 262k 컨텍스트로 구동했습니다. 0.1.39 버전에서 0.1.40.1 버전으로 업그레이드한 후, nvidia-smi를 확인하니 상당량의 VRAM이 사용되지 않고 남아 있는 것을 발견했습니다. 처음에는 Strata가 VRAM을 남겨두는 것(버그)인지 의아했습니다.
-
v0.1.40.1은 약 10.7 GiB의 VRAM을 사용하지 않은 채로 남깁니다 (실시간 nvidia-smi). GPU 총 용량(MiB) | 사용량 | 여유 공간 RTX 5060 Ti 16,311 | 15,514 | 337 RTX 3060 12,288 | 5,580 | 6,332 RTX 3090 24,576 | 23,799 | 328 RTX 3060 12,288 | 7,912 | 4,000 총계 65,463 | 52,805 | 10,997 약 51.6 GiB 사용, 63.9 GiB 중 약 10.7 GiB 여유 — 이 여유 VRAM은 주로 두 개의 3060에 남아 있습니다 (6.3 + 4.0 GiB). 따라서 Strata는 실제로 카드들을 가득 채우고 있지 않습니다. 버그일까요?
-
캐싱하는 전문가(expert) 수가 약 24% 적습니다. 모델은 다음과 같이 고정되어 있습니다: 48 MoE 레이어 x 512 전문가 = 24,576 개의 캐시 가능한 전문가 (추가로 항상 활성화되는 공유 전문가 48개). "상주하는 전문가(Resident experts)"는 Strata가 GPU에 유지하는 전문가의 수입니다. 엔진 | 상주 전문가 (GSQ-RCO) | 상주 전문가 (orca) 0.1.36 | 23,354 | - | 0.1.38 | 23,170 | 22,131 0.1.39 | 23,168 | 22,145 0.1.40.1 | 17,515 | 18,586
이는 0.1.40.1에서 각각 -24% (GSQ-RCO) 및 -16% (orca)의 상주 전문가가 줄어들었으며, 이것이 바로 여유 VRAM이 발생하는 원인입니다.
- ...하지만 캐시 적중률(cache hit rate)은 거의 변하지 않았고, 실제 생성 속도는 오히려 향상되었습니다. 엔진 | 캐시 적중률 | Gen tok/s 0.1.36 | 99.7% | 65.4 0.1.38 | 99.9% | 69.2 0.1.39 | 99.7% | ~87 0.1.40.1 | 98.1% | 104
적중률은 약 1.6 포인트 하락했지만, 상주 전문가가 24% 감소했습니다. 디코딩(Decode) 속도는 증가했습니다.
왜 버그가 아닌가 (Flash Next에 따르면): Strata가 줄인 전문가들은 '콜드(cold)'합니다. 프로파일링은 라우팅된 질량(routed mass)에 따라 전문가를 순위 매기며, 꼬리 부분(tail)이 트래픽의 <2%만을 차지합니다. 이들을 캐싱하는 것은 ~0%의 적중률 향상만 가져옵니다. 콜드한 전문가를 PCIe를 통해 스필링(spilling)하는 것이 비용이 들지 않는 이유는 그것이 0.1%의 빈도로만 사용되기 때문입니다. 일부가 비어 있는 카드들(3060)은 레이어가 그들의 캐시된 전문가로 거의 라우팅되지 않는 곳이며, 여기에 콜드한 전문가를 채워도 아무런 이득이 없습니다. 따라서 "사용하지 않은 VRAM"은 여유 공간(headroom)이며, 예전에 그것을 채웠던 전문가들은 쓸모없는 데이터였습니다.
(명명 참고: 엔진 배너는 빌드의 CMake 프로젝트 버전이 업데이트되지 않았기 때문에 '0.1.40'을 출력하지만, 실행 중인 바이너리에 체크아웃된 릴리스는 v0.1.40.1입니다 — 최신 버전입니다.) (주의 사항: 생성 점프는 엔진의 일부이며, 0.1.40.1이 370W 구동 대비 낮은 250W 전력 제한으로 실행되었기 때문이기도 합니다 — 하지만 디코딩은 낮은 제한에도 불구하고 개선되었으므로, 엔진 성능 향상은 실제입니다. 히트율은 라이브 서버(live-serve)로 측정되었습니다; 0.1.39의 생성 점수는 라이브 서버 평균값이며, 나머지는 매치드 하네스 벤치 테스트 결과입니다. nvidia-smi는 라이브 서버를 반영하므로, VRAM 총량은 0.1.40.1에 대한 것입니다.) submitted by /u/Critical-Entry3377 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기