단일 AMD MI300X에서 DeepSeek V4 Flash 실행하기
요약
AMD MI300X 단일 장치를 활용하여 DeepSeek V4 Flash 모델을 효율적으로 실행하는 방법과 비용 효율성을 분석합니다. 문맥 창을 조정하여 성능 저하를 최소화하면서도 높은 토큰 생성 속도를 유지하는 실질적인 절충안을 제시합니다.
핵심 포인트
- AMD MI300X를 활용한 DeepSeek V4 Flash 추론의 비용 효율성 분석
- 문맥 창을 100만에서 25.6만 토큰으로 줄여 성능과 메모리 사이의 현실적 절충
- 초당 150토큰 이상의 속도와 원본 가중치 보존을 통한 품질 유지
- H800 대비 MI300X의 최적화 필요성 및 하드웨어 구성(OAM vs PCIe) 고려
MI300X 단일 장치는 살 수 없고, 약 25만 유로인 8개 묶음 시스템만 구매 가능한 것 아닌가?
일부 클라우드 사업자에서 필요할 때 빌릴 수 있음. DigitalOcean 기반의 AMD Developer Cloud가 시간당 1.99달러로 가장 저렴해 보임
생각해 보니 원본 가중치의 DeepSeek V4 Flash 0731을 전용 추론 서버에서 실행하는 가장 저렴한 방법일 수도 있음. 혼합 부하 벤치마크는 해보지 않았지만, 사용자별 처리량을 쓸 만한 수준으로 유지하면서 시간당 3~4달러어치 토큰을 생성할 수 있을 듯함
eBay에서 약 2만 달러에 구할 수 있지만 백플레인이 빠져 있으며, H200용 제품처럼 중국산 PCIe 어댑터 카드가 있는지는 모르겠음
MI350P도 있고 약 96GB인 antirez 혼합 양자화 모델 정도는 잘 실행할 것임. 하지만 같은 가격이면 RTX Pro 6000 두 장이나 R9700 8장 이상과 구동 장비까지 마련할 수 있음
아니면 중고품을 구해 어댑터 보드에서 실행할 수도 있음. SXM A100도 이런 방식으로 유통됨
192GB HBM과 256GB RAM을 보기 전까지는 소비자용 GPU인 줄 알았음
AI 거품이 꺼지면 이런 제품이 중고 시장에 쏟아질 것임
선행 작업 목록에 DwarfStar가 없는 게 이상함. 양자화 방식은 다를 수 있지만 같은 모델을 더 적은 메모리에서 실행할 수 있는데, 작성자가 모르는 것일 수도 있음
이 저장소는 MI300X에 초점을 맞추며, DwarfStar에는 이를 위한 최적화나 수정 사항이 없음
또 “모델을 특정 장비에서 실행했다”는 제목이라 얼마나 많은 것을 포기했는지부터 살펴봤음. 성능을 크게 떨어뜨리는 양자화는 없고 의도된 추론 가중치를 완전히 보존했으며, 속도도 초당 150토큰 이상으로 보임
대신 원래 100만 토큰으로 학습·제공되는 문맥 창을 25만 6천 토큰으로 줄였음. Codex도 이 범위이고 최대 크기에 가까워질수록 품질이 떨어지기 시작하므로 매우 현실적인 절충안임
내게는 100만 토큰 문맥이 오히려 지나치게 큼. OAI에서 DSv4P로 처음 바꿨을 때 압축이 전혀 필요하지 않아 설정이나 실행 도구가 잘못된 줄 알고 몇 시간이나 확인했음. 품질 저하는 Codex에서 압축을 거듭할 때 발생하는 저하보다 작다고 볼 수 있음
Codex 문맥 창 상당 부분이 원하지도, 사용하지도 않는 내용으로 소모된다는 사실도 놀라웠음. 각종 플래그로 대부분 없앨 수 있지만 전문가 대상 월 200달러 제품에서 사용자가 직접 청소해야 할 일은 아님. 반복된 실수를 덮으려고 누적형 초기화를 임시방편으로 추가한 것도 마찬가지임
인상된 요금에서도 DeepSeek에 20달러를 쓰면 정말 오래 사용할 수 있음. 더 일찍 시험했다면 올해 OAI에 낸 1,200달러로 얼마나 많은 일을 할 수 있었을지 생각하니 후회됐음
공개 가중치 모델에서 전문가 모듈을 제거하는 연구가 있었는지 궁금함. 품질을 훼손하지 않으면서 데스크톱 GPU에서 실행할 수 있도록 크기를 줄이는 게 목표임
코딩처럼 용도가 한정됐다면 세계사까지 아는 모델은 필요 없음. 양자화가 아니라 특정 용도에서 활성화되는 전문가를 판별하고 나머지를 외과적으로 제거할 수 있는지가 궁금함
아직 DeepSeek가 H800에서 얻는 성능과는 상당한 차이가 있음. DSpark 논문에는 GPU당 초당 1만 5천 토큰 처리량이 보고됐음. MI300도 H800과 경쟁할 수 있어야 하므로 아직 적용할 최적화가 많아 보임
GPU를 잘 연결하고 wideEP로 배포하면 GPU 수가 늘어날수록 처리량이 초선형으로 증가하므로 한 장짜리 구성과 비교할 수 없음
DSpark 논문의 수치가 실제로 H800을 사용한 결과와 일치하는지도 확인해 보면 흥미로울 듯함. 논문에서는 GPU가 H800이라고 명시하지 않음
아쉽게도 MI300X는 OAM 모듈임. 필요한 제품은 PCIe 카드인 MI350P지만 메모리가 144GB로 더 적음
DeepSeek V4 Flash의 256개 MoE 내보내기 결과는 기본적으로 MXFP4 양자화돼 있어 144GB에서도 실행될 것임
어떻게 가능한지 의문임. 가중치만 vLLM에 올려도 156GB를 사용했고, 준비 실행과 KV 캐시 풀까지 추가하면 200GB를 넘었음
게다가 이 구현은 원래 제공되는 100만 토큰 문맥 창도 이미 줄인 상태임
MI350P는 PCIe 카드지만 서버용 제품임. 팬 없는 방열판만 달려 있어 랙마운트 서버의 강력한 케이스 팬으로 냉각하도록 설계됐으므로, 일반 그래픽 카드처럼 게이밍 PC에 바로 꽂아 쓸 수는 없음
다만 그래픽 카드에 수만 달러를 쓸 생각이라면 랙마운트 케이스를 추가하는 비용은 미미함
하드웨어 프로그래밍 인터페이스가 양자화하지 않은 수조 개 매개변수의 최전선 모델 추론을 구현하기에 합리적인지 궁금함
공개 가중치 최전선 모델의 매개변수는 수조 개인지, 수백조 개인지도 궁금함
모두 활성 매개변수가 아닌 전체 매개변수 수 기준으로 Kimi-K3는 2.8조 개, Qwen3.8-Max는 2.4조 개, DeepSeek V4 Pro는 1.6조 개, DeepSeek V4 Flash는 2,840억 개임
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기