이미지 생성 AI를 위한 GPU 성능 선택 기준 분석
요약
본 기사는 이미지 생성 AI를 위한 GPU 선택 기준을 분석하며, 단순히 VRAM 용량만 중요한 것이 아님을 실측 비교로 보여줍니다. 같은 16GB VRAM이라도 모델에 따라 생성 속도 차이가 크며, 특히 VRAM 대역폭이 성능 향상에 영향을 미치는 것으로 나타났습니다.
핵심 포인트
- VRAM 용량 자체보다 GPU의 연산 성능과 대역폭이 중요합니다.
- 같은 16GB라도 세대별/모델별 생성 속도 차이가 크게 발생했습니다.
- 실측 결과, VRAM 대역폭이 이미지 생성 성능에 영향을 미치는 것으로 보입니다.
이미지 생성 AI용으로 GPU를 선택할 때, 무엇을 기준으로 고르면 좋을까요?
GPU의 스펙을 살펴보면 주로 다음과 같은 요소들이 있습니다.
- GPU 자체의 연산 성능
- VRAM 용량
- VRAM 대역폭
- CUDA 코어 수
- Tensor Core의 세대 및 성능
특히 이미지 생성 AI에서는 'VRAM 용량이 중요하다'는 말이 많지만, VRAM 용량이 크면 이미지 생성 자체가 빨라지는 것일까요?
이번에는 가지고 있는 다음 GPU들을 사용하여 실제 이미지 생성 시간을 비교했습니다.
- GeForce RTX 3060 12GB
- GeForce RTX 4070 Ti SUPER 16GB
- GeForce RTX 5060 Ti 16GB
- GeForce RTX 5080 16GB
그 결과로부터,
'이미지 생성 AI에서 VRAM 용량, VRAM 대역폭, GPU 연산 성능 중 무엇이 중요한가'
를 생각해 보았습니다.
이번에 비교한 GPU들의 주요 사양을 정리합니다.
| GPU | VRAM 용량 | 메모리 버스 폭 | VRAM 대역폭 |
|---|---|---|---|
| RTX 3060 | 12GB | 192bit | 360 GB/s |
| ... | |||
| RTX 5060 Ti, RTX 4070 Ti SUPER, RTX 5080은 모두 VRAM 용량이 16GB입니다. |
따라서,
'같은 VRAM 용량이라도 이미지 생성 속도에 얼마나 차이가 나는지'
를 보기에는 적절한 비교가 되었습니다.
참고로, CUDA 코어 수나 Tensor Core 등은 GPU 세대에 따라 성능이 다르기 때문에, 단순히 코어 수만으로 연산 성능을 비교할 수는 없습니다.
필자의 환경에서는 AMD Radeon RX 7700 XT도 사용할 예정이었으나, 동작이 안정적이지 않아 제외하여 비교했습니다.
평소 사용하던 Anima의 생성 패턴을 사용하여 100장 연속 생성한 시간을 측정했습니다.
| GPU | 100장 생성 시간 | 1장당 | RTX 3060 대비 |
|---|---|---|---|
| RTX 3060 | 85분 03초 | 51.03초 | 1.00배 |
| ... | |||
| 상당히 큰 차이가 나타났습니다. |
특히 주목하고 싶은 것은 RTX 5060 Ti, RTX 4070 Ti SUPER, RTX 5080 세 모델입니다.
이들은 모두 VRAM 16GB입니다. 하지만 생성 시간은,
RTX 5060 Ti 28.49초
↓
RTX 4070 Ti SUPER 18.48초
...
이 되었습니다.
RTX 5080은 RTX 5060 Ti에 비해,
28.49 / 12.66 ≒ 2.25
약 2.25배의 생성 속도입니다.
같은 16GB라도 생성 성능에는 이 정도 차이가 있습니다.
이 결과로부터 가장 먼저 알 수 있는 것은,
VRAM 용량 그 자체와 이미지 생성 속도는 별개
라는 것입니다.
RTX 5060 Ti, RTX 4070 Ti SUPER, RTX 5080은 모두 16GB입니다. 그럼에도 불구하고, 생성 속도에는 최대 약 2.25배의 차이가 있었습니다.
따라서 이번 Anima 생성 조건에서는,
VRAM 16GB이므로 비슷한 수준의 생성 성능을 보인다```
라고 할 수 없습니다.
VRAM 용량은 '얼마나 빠르게 계산할 수 있는지'라기보다는,
**모델이나 생성 처리에 필요한 데이터를 GPU에 유지할 수 있는지**
라는 역할로 이해하는 것이 더 쉬울 것 같습니다.
다음으로 VRAM 대역폭을 비교합니다.
| GPU | VRAM 대역폭 | RTX 3060 대비 | 실측 생성 속도 비율 |
|---|---|---|---|
| RTX 3060 | 360 GB/s | 1.00배 | 1.00배 |
| ... |
VRAM 대역폭이 커질수록 생성 속도도 향하고 있습니다.
따라서, **VRAM 대역폭이 이미지 생성 성능에 영향을 미치고 있다**는 것은 충분히 생각해 볼 수 있습니다.
다만, 완전한 VRAM 대역폭 한계(bottleneck)라고 보기는 어려울 것 같습니다.
RTX 3060에서 RTX 5080까지 VRAM 대역폭이 약 2.67배인 것에 비해, 실제 생성 속도는 약 4.03배가 되었습니다.
즉, VRAM 대역폭만으로는 이 성능 차이를 설명할 수 없습니다.
이미지 생성 AI에서는 방대한 행렬 연산(matrix multiplication)이 실행됩니다.
따라서,
- CUDA 코어
- Tensor Core
- FP16/BF16/FP8과 같은 저정밀도 연산 성능
- GPU 아키텍처
- Attention 등을 처리하는 커널(kernel)
등 GPU 자체의 능력 또한 중요합니다.
이번 결과에서도 새로운 상위 GPU일수록 생성 속도가 크게 향상하고 있습니다.
반면에 GPU 세대가 다르기 때문에,
CUDA 코어가 2배
↓
이미지 생성도 2배
와 같은 단순한 비교는 할 수 없습니다.
GPU 연산 성능과 VRAM 대역폭(bandwidth) 모두가 향상하고 있기 때문에, 이번 실측만으로는 두 요소의 기여도를 완전히 분리하기 어렵습니다.
따라서 이번 결과에 대해서는,
**GPU 연산 성능과 VRAM 대역폭 양쪽 모두가 이미지 생성 속도에 크게 영향을 미치고 있다**
라고 생각하는 것이 타당할 것입니다.
다른 모델로 Krea2에서도 측정했습니다.
이것은 20장을 생성한 결과입니다.
| GPU | 20장 생성 시간 | 장당 시간 |
|---|---|---|
| RTX 5060 Ti | 11분 25초 | 34.25초 |
| RTX 5080 | 5분 16초 | 18.80초 |
생성 속도 차이는,
34.25 / 18.80 ≒ 1.82
이 되어, RTX 5080이 약 1.82배 빨랐습니다.
흥미롭게도, 같은 5060 Ti와 5080을 비교할 때도 Anima과 Krea2의 배율은 다릅니다.
Anima
RTX 5080 ≒ 2.25배
Krea2
...
이는 사용하는 모델에 따라 GPU 성능 활용 방식이 다르다는 것을 시사합니다.
모델 구조, Attention, 텍스트 인코더(text encoder), VAE, CPU 처리, 메모리 전송, 사용되는 커널 등에 따라 병목 현상(bottleneck)이 달라지기 때문입니다.
따라서, **실제로 사용하는 모델・해상도・생성 설정에 따라 성능 차이가 변화한다**고 생각하는 것이 좋을 것 같습니다.
이번 결과만으로 판단할 때, 모델이 VRAM에 수용된 상태에서의 생성 속도 영향은 대략 다음과 같이 생각할 수 있습니다.
GPU 연산 성능 ≳ VRAM 대역폭 >>> VRAM 용량
다만, 이것이 **'VRAM 용량이 중요하지 않다'**는 의미는 아닙니다.
VRAM 용량은 연산 성능이나 대역폭과는 다른 역할을 합니다.
이미지 생성 AI용 GPU를 고려할 때, VRAM 용량은 다음과 같이 생각하면 이해하기 쉽습니다.
사용하고 싶은 모델
│
▼
...
필요량이 10GB인 처리에 대해 16GB의 GPU를 사용한다면, VRAM을 24GB나 32GB로 늘렸다고 해서 이미지 생성이 빨라지지는 않습니다.
하지만 20GB가 필요한 모델에 16GB GPU를 사용하면, CPU RAM으로 오프로드(offload) 등이 발생할 가능성이 있습니다.
이 경우에는 상황이 역전됩니다.
**VRAM 용량 부족 그 자체가 최대의 병목 현상**이 될 수 있습니다.
즉 VRAM 용량은 '많을수록 빠르다'는 성능 지표가 아니라, **필요량을 충족하고 있는가**라는 조건으로 보는 것이 좋을 것 같습니다.
생성 속도에 대해서는,
- GPU 연산 성능
- VRAM 대역폭
- VRAM 용량
다만 1과 2는 밀접하게 관련되어 있어, 이번 실측만으로는 완전히 분리할 수 없습니다.
GPU 연산 성능과 VRAM 대역폭 양쪽을 모두 봐야 합니다.
반면, VRAM 용량에 대해서는 필요량을 초과한 부분이 직접적으로 생성 속도 향상으로 이어질 가능성은 낮다고 생각됩니다.
이 쪽은 순위가 크게 바뀝니다.
- VRAM 용량
- GPU 연산 성능
- VRAM 대역폭
라기보다는, **필요 VRAM 용량을 충족하는 것이 대전제**입니다.
그 조건을 만족한 후에 연산 성능과 대역폭을 비교해야 할 것입니다.
이번 실측 결과를 전제로, 보유하고 있는 4개 중에서 이미지 생성에 사용할 GPU를 고른다면 추천 순서는 다음과 같습니다.
| 순위 | GPU | VRAM | Anima (장당) | RTX 3060 대비 | 평가 |
|---|---|---|---|---|---|
| 1위 | RTX 5080 | 16GB | 12.66초 | 약 4.03배 | 최우선 |
| 2위 | RTX 4070 Ti SUPER | 16GB | 18.48초 | 약 2.76배 | 충분히 빠름 |
| 3위 | RTX 5060 Ti | 16GB | 28.49초 | 약 1.79배 | VRAM 용량은 같으나 속도는 떨어짐 |
| 4위 | RTX 3060 | 12GB | 51.03초 | 1.00배 | 4개 중 가장 느림 |
이번 환경에서는 RTX 5080이 명확하게 가장 빨랐습니다.
Anima에서는 **12.66초/장**, Krea2에서도 **18.80초/장**이라는 결과입니다. Anima로 100장을 생성했을 경우 소요 시간은 다음과 같았습니다.
대량으로 생성할수록 이 시간 차이가 효과적으로 나타납니다. 처리 속도를 최우선으로 한다면, RTX 5080이 첫 번째 후보입니다.
이번 결과에서 주목해야 할 것은 RTX 4070 Ti SUPER입니다.
RTX 5060 Ti와 **동일한 16GB**임에도 불구하고, Anima의 생성 시간은 다음과 같았습니다.
RTX 5060 Ti 28.49초
↓ 약 1.54배 고속
RTX 4070 Ti SUPER 18.48초
두 가지를 모두 보유하고 있을 경우, 'RTX 5060 Ti가 더 새로운 세대라서'라는 이유만으로 우선할 메리트는 적으며, 생성 속도를 중시한다면 RTX 4070 Ti SUPER를 선택하는 것이 합리적입니다.
생성 속도 면에서는 RTX 4070 Ti SUPER에 미치지 못하지만, **16GB의 VRAM을 탑재하고 있다는 것**에는 의미가 있습니다.
RTX 3060보다 약 1.79배 빠르며, VRAM 용량 또한 12GB에서 16GB로 늘어나기 때문에, RTX 3060보다 VRAM 사용량이 많은 모델이나 생성 조건에 대응하기 쉬워집니다.
이번 4가지 중에서는 다음과 같은 위치를 차지합니다.
가장 빠르지는 않지만, 16GB의 VRAM을 확보할 수 있는 이미지 생성용 GPU
Anima에서는 RTX 5080과의 차이가 약 4배에 달하기 때문에, 생성 속도를 중요하게 생각한다면 메인 이미지 생성 GPU로 적극적으로 선택할 이유는 적습니다.
하지만 이는 RTX 3060이 이미지 생성에 사용할 수 없다는 의미는 아닙니다. 12GB의 VRAM이 있기 때문에 **서브 생성 환경, 별도 작업 병렬 실행, LLM이나 이미지 생성 실험 환경**으로 활용할 수 있습니다.
이번 결과를 종합해 볼 때, 이미지 생성 AI용 GPU를 새로 구매할 때는 단순히 'VRAM이 가장 많은 GPU'나 '연산 성능이 가장 높은 GPU'가 아닙니다.
필자의 감상으로는, 이미지 생성 AI에서는 10GB 이하일 경우 VRAM 부족으로 작동하지 않는 모델도 많기 때문에, **VRAM 10GB 이상의 GPU를 선택하는 것이 최소 조건**이라고 생각합니다.
반대로 사용하고 싶은 모델이 약 24GB가 필요하다면, 16GB GPU는 연산 성능이 높아도 후보에서 제외될 가능성이 있습니다.
필요 VRAM 용량을 충족했다면, 다음으로 GPU 자체의 연산 성능을 비교합니다.
이미지 생성 AI에서는 Tensor 연산 등이 대량으로 실행되기 때문에, 이 부분이 실제 생성 시간에 크게 영향을 줍니다.
이번에도 동일한 16GB로,
RTX 5060 Ti 28.49초
RTX 4070 Ti SUPER 18.48초
RTX 5080 12.66초
처럼 큰 차이가 나타납니다.
특히 처음 생성해 보며 시험 삼아 사용한다면 5060Ti로도 충분하지만, 나중에 **생성 속도를 중시한다면 4070 Ti SUPER나 5080을 선택하는 것이 좋을** 것입니다.
동일 클래스에서 고민된다면 VRAM 대역폭(bandwidth)도 중요합니다.
LLM도 이용할 계획이라면, 예산이 허락하는 범위 내에서 RTX 4070 Ti SUPER나 RTX 5080처럼 VRAM 대역폭이 넓은 GPU를 선택하는 것이 생성 속도 향상으로 이어질 가능성이 있습니다.
특히 GPU 연산 성능이 높아도 메모리로부터 충분한 속도로 데이터를 공급받지 못하면 GPU를 온전히 활용할 수 없습니다.
따라서,
필요 VRAM 용량
↓
GPU 연산 성능
...
순서로 후보를 좁혀나가는 방법이 좋다고 생각합니다.
이번에 RTX 3060, RTX 5060 Ti, RTX 4070 Ti SUPER, RTX 5080을 사용하여 이미지 생성 시간을 비교했습니다.
Anima에서는 RTX 3060의 51.03초/장 대비, RTX 5080은 12.66초/장이 되어 약 4배의 생성 성능이 되었습니다.
또한 동일한 16GB인 RTX 5060 Ti, RTX 4070 Ti SUPER, RTX 5080에서도 큰 성능 차이가 확인되었습니다.
이 결과로부터 이미지 생성 AI에서의 GPU 선택은 **'VRAM 용량만 보고 고르는 것'은 적절하지 않다**고 생각합니다.
물론 VRAM 용량이 부족하면 GPU 연산 성능 이전의 문제입니다.
따라서 새로 GPU를 구매할 때는,
① 사용하고 싶은 모델에 필요한 VRAM 용량을 확보한다
↓
② 조건을 충족하는 GPU부터 연산 성능을 비교한다
...
이러한 선택 방식이 좋을 것 같습니다.
간단히 요약하자면,
VRAM 용량은 '어디까지 할 수 있는지'를 결정하고, GPU 연산 성능과 VRAM 대역폭은 '얼마나 빠르게 할 수 있는지'를 결정합니다.
이번 실측 결과를 보면, 이미지 생성 AI용 GPU를 선택할 때는 이 생각이 가장 현실에 가깝지 않다고 생각합니다.
이번 결과는 필자의 환경 및 특정 Anima・Krea2 생성 조건에서 측정된 것입니다.
이미지 생성 AI의 성능은,
- 사용 모델
- 해상도
- Steps
- Sampler
- 정밀도(FP16/BF16/FP8 등)
- Attention 구현
- PyTorch/CUDA 버전
- WebUI
- GPU 드라이버
- CPU/RAM
- 오프로드 설정
등에 따라 변화합니다.
따라서 본 기사의 결과를 각 GPU의 절대적인 성능 차이로 다루기보다는, **실제 이미지 생성 환경에서의 하나의 실측 예시**로 참고해 주십시오.
솔직히 말해서, 제 환경에서 게임을 이용할 때는 RTX 3060과 RTX 5080의 차이를 체감하기 어렵지만, 이미지 생성 AI에서는 이 차이가 크게 나타나는 것을 느꼈습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기