ComfyUI에서 AMD V620 워크스테이션 카드를 사용한 성공 사례
요약
AMD Radeon Pro V620 워크스테이션 카드를 ComfyUI 및 로컬 LLM 환경에서 사용한 성공 사례를 공유합니다. 속도는 빠르지 않지만 32GB의 VRAM을 활용해 이미지, 비디오 생성 및 LLM 구동에서 안정적인 성능을 보여줍니다.
핵심 포인트
- AMD V620 카드는 ComfyUI 및 로컬 LLM 환경에서 안정적으로 작동함
- 32GB의 대용량 VRAM을 통해 이미지 및 비디오 생성 모델 활용 가능
- ROCm 환경에서 gfx1030 아키텍처로 식별되며 Triton 및 Sage Attention 지원
- 속도는 느리지만 일관된 성능을 제공하며 가성비 측면에서 활용 가치가 있음
요약(TLDR): 이 카드가 정말 마음에 듭니다. ComfyUI에서 잘 작동하며, 로컬 LLM (Large Language Models)에서는 훨씬 더 잘 작동합니다. 이곳에서도 이미지 및 비디오 생성 모델을 논의하거나 사용하는 분들이 많다는 것을 알기에 r/StableDiffusion 서브레딧에서 이 글을 다시 게시합니다. 앞으로 몇 주 안에 llama.cpp 및 LLM에 대한 벤치마크(benchmarks)를 내놓을 예정입니다. 몇 주 전, ComfyUI를 위해 V620을 사용할 가치가 있는지에 대해 글을 올렸을 때, 적어도 Windows 11에서는 작동하지 않을 가능성이 높다는 답변을 받았습니다. 만약 작동하더라도 너무 느려서 사용할 수 없을 것이라고도 했습니다. 저는 어쨌든 시도해 보기로 했습니다. 빠른가요? 아니요. 작동하나요? 네, 확실히 작동합니다. 저는 배송비 포함 320달러에 이 카드를 구매했고(고마운 레딧 유저님!), 팬과 3D 프린팅 슈라우드(shroud)를 위해 eBay에서 40달러를 썼습니다. 제 9070 XT 바로 아래의 두 번째 슬롯 PCIE 4 X4에 장착했습니다. V620용 드라이버(drivers)가 설치되었으며, 제 XT GPU와 함께 잘 작동하고 있습니다. 지금까지 충돌이나 오류는 없었습니다 (행운을 빌어주세요!). 저는 주로 로컬 어시스턴트를 위한 LLM용 VRAM (32GB) 때문에 이 카드를 구매했습니다. 그것이 여전히 주 용도이지만, 백그라운드에서 이미지/비디오를 생성하는 것도 좋아합니다. 이 카드는 그 용도에 완벽합니다. 빠르지는 않지만 일관적입니다. 아래의 벤치마크는 AI가 작성했지만, 제가 직접 테스트하여 검증했습니다. triton 및 sage attention을 완벽하게 작동시키는 데 성공했습니다. ROCm 환경에서 gfx1030 GPU로 식별됩니다. GPU-Z 및 장치 관리자 사진: https://imgur.com/a/PTsy8Ko 질문이 있거나 특정 모델을 테스트해 보길 원하신다면 알려주세요. 시간이 되면 해보겠습니다.
ComfyUI 워크플로우 벤치마크 환경 ComfyUI 버전: 0.26.0 GPU: AMD Radeon Pro V620 (ROCm, HIP_VISIBLE_DEVICES=0 , gfx1030 아키텍처, 레거시-GPU 코드 경로) Python env: python_env_v620_triton (Triton/sage-attention 빌드) 실행 매개변수: --listen 127.0.0.1 --port 8188 --use-sage-attention --highvram --disable-pinned-memory --reserve-vram 1 --enable-manager --enable-manager-legacy-ui --disable-api-nodes --cache-none --fp8_e4m3fn-text-enc Sage attention: 활성화됨 ( --use-sage-attention ), 이전 내부 벤치마크 노트에 따르면 : "plain SDPA 대비 sage-attention이 샘플러 스텝 시간을 약 16% 단축하며, 품질 저하가 관찰되지 않았습니다." 기타 관련 환경 변수: PYTORCH_HIP_ALLOC_CONF=expandable_segments:True,garbage_collection_threshold:0.7 , MIOPEN_FIND_MODE=FAST , TORCH_BACKENDS_CUDA_FLASH_SDP_ENABLED=0 (레거시 GPU 경로), FLASH_ATTENTION_TRITON_AMD_ENABLE=TRUE 방법: 각 테스트는 ComfyUI 자체 프론트엔드를 통해 로드됨 실행 횟수: 이미지 및 이미지-투-비디오 테스트는 1회 실행; 텍스트-투-비디오 테스트는 2회 실행 (첫 번째 실행은 모델/torch-compile 로드 비용을 지불하며; 두 번째 실행은 따뜻한 캐시(warm cache)의 이점을 얻음) — 행별로 명시됨. 비디오 테스트: 벤치마킹 속도를 위해 약 10초 출력으로 제한됨 이름 지정: 아래의 테스트 레이블은 각 파이프라인이 수행하는 작업에 대한 일반적/익명화된 설명이며, 로컬에서 사용된 개인 파일 이름은 아닙니다 — 기본 모델/아키텍처 및 크기는 정확하게 제공되어 하드웨어를 비교하는 모든 사람에게 숫자가 의미 있게 전달됩니다. 아래에는 z img turbo, ltx 2.3, wan 2.2, flux, pony 등이 있습니다. LORA가 몇 개 더 있습니다. Ace-step music도 진행되었지만 벤치마크 결과를 제공하는 것을 잊었습니다. 3분짜리 노래를 처음부터 끝까지 만드는 데 약 3분이 걸렸습니다. 일부 이중 워크플로우는 안전하지 않은 콘텐츠(not safe for work)였기 때문에 게시 규칙에 따라 제거했습니다.
결과
| 테스트 | 베이스 모델 (Base model) | LoRA / 애드온 (add-on) | 해상도 (Resolution) | 1회차 실행 (cold) | 2회차 실행 (warm) | 비고 (Notes) |
|---|---|---|---|---|---|---|
| 일반 실사 (distilled turbo) | Z-Image Turbo, distilled diffusion transformer | — | 1920x1080 | 59s | 47s | 9 steps, cfg 1.0 |
| 애니메이션 스타일 (Anime style) | SDXL, Illustrious-family fine-tune | — | 896x1152 | 42s | 25s | |
| 퍼리 스타일 A (hires-fix 포함) | SDXL, Illustrious-family fine-tune | — | 1024x1024 | 124s | 119s | tiled hires-fix 패스 + torch.compile 포함; warm-cache 이점 적음 (매번 다중 형태 재컴파일 발생) |
| 캐릭터 참조 (이미지 조건부) | SDXL, Illustrious-family fine-tune | IPAdapter Plus (ViT-H image-reference conditioning) | 1024x1024 | 36s | 31s | |
| 이미지 편집 (참조 가이드) | Flux.2 Klein-family, large (~30B-class) | — | 1024x1024 | 326s | 325s | Kontext-style 이미지 편집 — SDXL-family 테스트보다 훨씬 느림, warm-cache 이점 없음 (연산 제한적이지 않고 로드 제한적임) |
| 일반 실사 (대형 모델) | Flux.2 Klein-family, large (~30B-class) | — | 1024x1024 | 154s | 150s | 이미지 편집 테스트와 동일한 베이스 모델이지만 순수 텍스트-투-이미지 (text-to-image) (편집/참조 패스 없음) — 눈에 띄게 빠름 |
| 퍼리 스타일 B | SDXL, Illustrious-family fine-tune | — | 896x1152 | 32s | 26s | |
| 퍼리 스타일 C (Pony 계열) | SDXL, Pony Diffusion-family fine-tune | Furry-realism LoRA (Pony) | 896x1152 | 32s | 25s | |
| 퍼리 스타일 D (최대 실사) | SDXL, Illustrious-family fine-tune | Furry-realism LoRA (Illustrious) | 896x1152 | 35s | 32s | |
| 일반 실사, 2패스 정밀화 | SDXL, Pony Diffusion-family fine-tune | — | 512x512 | 35s | 31s | |
| 구조화된 프롬프트 실사 (JSON 기반) | Flux-family (Ideogram4), fp8 | — | 1024x1024 | ~372s | 356s | Guidance-distilled, 부정 프롬프트(negative prompt) 없음; torch.compile 패스 포함, warm-cache 이점 적음 (연산 제한적임) |
| 빠른 실사 (8-step distilled) | Krea 2 Turbo, distilled diffusion transformer (Qwen3-VL text encoder) | — | 1024x1024 | 156s | — | 1회 실행만 수행 |
| 인페인트 (Inpaint, 마스크 영역 교체) | SDXL, Pony Diffusion-family fine-tune | — | — | 47s | — | 1회 실행만 수행; 이 테스트를 위해 마스크를 칠하지 않았으므로, 이는 하한선 시간에 더 가까움 |
| 사진 복원/업스케일 | ESRGAN 스타일 업스케일 모델 (4x-UltraSharp), 디퓨전 체크포인트 없음 | — | 4x |
업스케일 6s — 단 1회 실행 — 순수 업스케일 패스 (upscale pass), 샘플링 (sampling) 없음, 따라서 이것은 진정으로 이만큼 빠른 Image-to-video (I2V)임, 일반 (10초 클립) LTX-2, 22B distilled Distilled LoRA 768x512, 10s @ 25fps ~978s ~956s 22B 비디오 모델 — 테스트된 그 어떤 이미지 워크플로우보다 훨씬 무거움 | Image-to-video (I2V), 퍼리 (furry) (10초 클립) LTX-2, 22B distilled Distilled LoRA + furry LoRA 768x512, 10s @ 25fps 1027s — 단 1회 실행 (i2v 테스트) | Text-to-video (T2V), 퍼리 (furry) (10초 클립) LTX-2, 22B distilled Distilled LoRA + furry LoRA 768x512, 10s @ 25fps 305s 305s LTX I2V 테스트보다 훨씬 빠름 — 이미지 컨디셔닝 (image-conditioning) 패스 없음; 두 실행 모두 동일한 시간 소요 (연산 제한적/compute-bound) | Text-to-video (T2V), 일반 (10초 클립) LTX-2, 22B distilled Distilled LoRA 768x512, 10s @ 25fps 275s 285s | Text-to-video (T2V), 애니메이션 스타일 (10초 클립) LTX-2, 22B distilled Distilled LoRA + 90s-anime-style LoRA 768x512, 10s @ 25fps 305s 305s | Image-to-video (I2V), 일반, WAN (10초 클립) WAN 2.2 lightx2v 4-step distill LoRA (high+low noise) 10s @ 24fps 894s — 단 1회 실행 (i2v 테스트) | Image-to-video (I2V), WAN (10초 클립) WAN 2.2 (fine-tune) lightx2v 4-step distill LoRA (high+low noise) 10s @ 24fps ~1041s — 단 1회 실행 (i2v 테스트) | Text-to-video (T2V), 일반, WAN (10초 클립) WAN 2.2 lightx2v 4-step distill LoRA (high+low noise) 832x480, 10s @ 24fps 163s 143s
/u/Brave_Load7620에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기