
3xMI50 32GB 환경에서 DS V4-Flash-0731을 로컬로 실행 (약 15 t/s TG)
요약
3xMI50 GPU 환경에서 DS V4-Flash-0731 모델을 로컬로 실행한 성능 테스트 결과입니다. 양자화된 모델을 통해 초당 약 15-16 토큰의 안정적인 생성 속도를 확인했습니다.
핵심 포인트
- 3xMI50(96GB VRAM) 환경에서 DS V4-Flash-0731 로컬 실행 성공
- 텍스트 생성 속도 초당 약 15-16 토큰 및 프롬프트 처리 속도 약 105-110 토큰 달성
- 복잡한 코딩 테스트(루빅스 큐브 HTML 생성)를 성공적으로 수행
- 양자화 모델을 활용한 로컬 LLM 구동 가능성 확인
여러분 안녕하세요. 간결하게 말씀드리겠습니다. 요약(TL;DR): DS V4-Flash-0731 @ UD-IQ2_M 모델을 3xMI50 (90.9 GB 모델, 96 GB VRAM) 환경에서 VRAM에 완전히 올려 실행했습니다. llama-server에서의 실제 속도는 다음과 같습니다:
- 텍스트 생성 (Text Generation): 초당 약 15-16 토큰(tokens/second)으로 안정적입니다. 모델이 30K 토큰 길이의 긴 답변을 생성할 때조차 초당 14 토큰 미만으로 떨어진 적이 없습니다.
- 프롬프트 처리 (Prompt Processing): 초당 약 105-110 토큰 정도입니다. 토큰 길이가 짧은 프롬프트를 처리할 때는 속도가 떨어졌는데, 이는 물론 매우 일반적인 현상입니다.
관심 있는 분들을 위한 llama-server CLI 로그입니다: https://pastebin.com/nXy9v0x8
모델과 짧은 대화를 나누어 보았습니다. 대체로 괜찮아 보였습니다. 언뜻 보기에 한 가지 실수를 발견했는데, MI50의 메모리 대역폭(1 TB/s)을 PCIe 4.0의 양방향 대역폭(64 GB/s)과 혼동했습니다.
관심 있는 분들을 위해 llama-server의 웹 UI에서 대화 내용을 .jsonl로 내보냈습니다. 여기에서 확인하실 수 있습니다: https://pastebin.com/CwHm5cTf
현재 양자화(quant) 품질을 철저히 평가할 시간이 많지 않아 단 한 번의 코딩 테스트만 진행했습니다. 제가 실행한 테스트는 16시간 전 u/perelmanych 님이 올린 게시물에서 복사해 온 것입니다. 구체적으로는 DeepSeek의 공식 API를 통해 DS V4-Flash-0731이 보여주고 코딩했던 루빅스 큐브(Rubik's cube) 테스트입니다. 따라서 저는 이것이 Full Precision 모델이라고 추측하고 있습니다. Full Precision의 정의에 따라 말하자면, 이 모델은 네이티브 FP4 + FP8 혼합 정밀도(mixed precision) 모델입니다.
사용된 프롬프트(앞서 언급한 게시물의 것과 동일)는 다음과 같습니다:
Canvas 애니메이션이 포함된 단일 HTML 파일을 생성하세요: 2D canvas 상에 시뮬레이션된 투영법으로 렌더링된 3D 루빅스 큐브 (WebGL 사용 금지, 라이브러리 사용 금지). 방향: 위쪽은 흰색, 앞쪽은 초록색, 오른쪽은 빨간색. 표준 표기법을 사용하세요: /F/B = 해당 면(앞/뒤/위/아래/왼쪽/오른쪽)에서 보았을 때 시계 방향 1/4 회전, 아포스트로피(') = 반시계 방향. 시퀀스: (1) 맞춰진 상태의 큐브가 2초 동안 천천히 회전하는 모습을 보여줍니다. (2) 정확히 다음 10개의 애니메이션 면 회전을 한 번에 하나씩 수행하여 섞습니다: R, U, F', D, L', B, R', U', F, D'. (3) 2초간 정지합니다.
(4) 정확히 다음 10개의 애니메이션 면 회전(face turns)으로 해결합니다: D, F', U, R, B', L, D', F, U', R'. (5) 해결된 큐브가 천천히 회전하며 종료됩니다. 각 면의 회전은 부드럽게 애니메이션되어야 하며(~0.5초), 모든 움직임 동안 스티커의 색상이 정확하게 추적되고, 스티커 사이의 간격이 보이며, 면의 방향에 따른 음영이 표현되어야 합니다. 큐브는 전체 과정 동안 공간에서 천천히 계속 회전합니다. 사용자 상호작용은 없습니다. 다음은 제가 로컬에서 실행한 DS V4-Flash가 생성한 HTML 코드의 pastebin 링크입니다: https://pastebin.com/43bzF2cm 실행되는 모습은 첨부된 클립을 확인해 주세요. 로컬 양자화 모델(quants)의 품질에 대해서는 아직 사용해 보지 않았기에 제대로 된 의견을 내는 것을 자제하겠습니다. 저는 그저, 이것을 로컬에서 실행할 수 있다는 사실 자체에 전반적으로 매우 놀랐을 뿐입니다. 저는 평소에 DS API를 그대로 자주 사용하는데, 원한다면 로컬에서 실행할 수 있는 옵션이 있다는 것이 놀랍습니다. submitted by /u/Kamal965 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기