RX 580 8GB에서 OpenAI 호환 API 뒤에 6개 LLM + SD 3.5 + Whisper 구동하기 - ROCm이 잊어버린 카드
요약
구형 그래픽 카드인 RX 580을 Vulkan/ROCm 환경에서 활용하여 OpenAI 호환 API 백엔드를 구축하고 여러 LLM과 SD 3.5, Whisper를 구동하는 방법을 소개합니다. 이는 최신 하드웨어 없이도 다양한 AI 모델을 온디맨드로 테스트할 수 있는 효율적인 개발 가이드입니다.
핵심 포인트
- ROCm 지원 중단된 RX 580에서 Vulkan/Mesa RADV 경로로 LLM 및 SD 구동 가능
- OpenAI 호환 라우터를 통해 여러 LLM과 모델을 단일 API 키로 관리
- 다양한 모델(qwen2.5, ornith 등)의 추론 속도 측정 결과를 제공하여 성능 비교에 유용함
ROCm은 Polaris를 오래전에 지원 중단했기 때문에, 모든 RX 580 소유자들은 새 카드를 사라고 듣습니다. 저는 대신 Vulkan 경로를 택했습니다: 전체 스택이 Mesa의 RADV 위에서 실행됩니다. 무엇을 구동하는지 (하나의 Debian LXC, 하나의 설정 스크립트): - OpenAI 호환 라우터, 하나의 API 키, 모델을 온디맨드(on demand)로 교체합니다 - qwen2.5-coder 1.5B/7B, qwen2.5-7B, ornith-1.5-9B, qwen3-30B-A3B, qwen2.5-VL-3B - 이미지: stable-diffusion.cpp를 통한 SD 3.5 Medium + SD 1.5, Whisper medium - 에이전트 클라이언트와 MCP 도구의 추론 백엔드도 측정했습니다. Ryzen 5 5600G / 32 GB RAM / RX 580 2048SP, 온도 0, max_tokens 300:
| Model | tok/s | warm | cold (after swap) |
|---|---|---|---|
| qwen2.5-coder-1.5b | 99.2 | 3.1 s | 11.0 s |
| qwen2.5-vl-3b | 66.4 |
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기