IBM AC922에서 Qwen3.8-FN UD-Q4_K_XL을 구동하는 Strata 포크 버전의 성능
요약
작성자는 IBM AC922 시스템에서 Strata를 포크하여 Opus 5.5 모델을 구동하는 과정을 공유합니다. 이 과정에서 메모리 관리, GPU의 expert caching 최적화, NVLink 활용 등 다양한 기술적 개선을 통해 성능을 크게 향상시켰습니다. 특히 프롬프트 읽기 속도와 생성 속도가 매우 높은 수치를 기록했습니다.
핵심 포인트
- IBM AC922 시스템 기반으로 Strata를 포크하여 Opus 5.5 구동 환경 구축
- 메모리 관리, expert caching 최적화 등 심층적인 기술 개선을 통해 성능 향상 달성
- 프롬프트 읽기 속도는 최대 7,350 tok/s, 생성 속도는 약 113 tok/s를 기록함
저는 Strata를 포크하여 제가 접근할 수 있는 IBM AC922에서 Opus 5.5로 작동하도록 많은 변경 작업을 거쳤습니다. IBM AC922는 2018년경의 강력한 시스템으로, 두 개의 POWER9 20 코어 SMT4 CPU가 NVLink을 통해 4개 또는 6개의 NVIDIA Tesla V100 SXM2 GPU와 연결되어 있으며, CPU-GPU 대역폭은 150GB/s로 광고되고 있고 nvidia 드라이버는 통합 메모리 액세스를 허용합니다.
제가 가진 머신에는 4개의 16GB GPU가 있습니다. llama.cpp로는 이 여정을 시작하기 전에 정말 형편없는 결과를 보여주었습니다. prefill에서 130 tok/s, decode에서 15 tok/s를 기록했죠.
그래서 저는 주말 내내 Opus와 싸웠고, FP16을 BF16 대신 사용하거나, 메모리 관리, GPU에서의 expert caching, 더 나은 NVLink 사용, CUDA 코어 작업보다는 Tensor Core 활용 등 사실과 논리로 이겨나갔습니다. Claude는 시간 간극 디버깅을 위해 nsight nsys를 실행하는 데 능숙했습니다.
프롬프트 읽기: 최대 7,350 tok/s, 252K 토큰 프롬프트(35초)에서도 여전히 7,090 tok/s입니다.
생성: 최대 약 113 tok/s (JSON), 코드에서는 약 100 tok/s, 산문에서는 약 84 tok/s (MTP speculative decoding)
252K 깊이에서의 후속 작업: 첫 토큰 출력까지 0.26초, 60 tok/s
모든 72 GiB의 expert는 양쪽 소켓 RAM에 페이지 잠금(page-locked)되어 있습니다. GPU들은 각각 약 70 GB/s로 NVLink 2.0에서 데이터를 가져옵니다.
제가 변경 사항 중 일부를 기여할 수 있도록 노력하겠지만, Strata가 계속해서 하드웨어 우선 추론 엔진으로 남을 것이라고 생각하며, 그것은 완전히 괜찮습니다. Niko1221이 훌륭한 일을 했습니다.
포크된 레포지토리: github.com/eelgaev/Strata-AC922
제출자: /u/okoyl3
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기