画像生成AIから見たGPU性能選択について
はじめに
画像生成AI用にGPUを選択する場合、何を基準に選べばよいのでしょうか。
GPUのスペックを見ると、主に以下の要素があります。
- GPUそのものの演算性能
- VRAM容量
- VRAM帯域幅
- CUDAコア数
- Tensor Coreの世代・性能
特に画像生成AIでは「VRAM容量が重要」と言われることが多いですが、VRAM容量が大きければ画像生成そのものが高速になるのでしょうか。
今回は手元にある以下のGPUを使用し、実際の画像生成時間を比較しました。
- GeForce RTX 3060 12GB
- GeForce RTX 4070 Ti SUPER 16GB
- GeForce RTX 5060 Ti 16GB
- GeForce RTX 5080 16GB
その結果から、
「画像生成AIにおいて、VRAM容量・VRAM帯域・GPU演算性能のどれが重要なのか」
を考えてみます。
今回使用したGPU
今回比較したGPUの主な仕様を整理します。
| GPU | VRAM容量 | メモリバス幅 | VRAM帯域幅 |
|---|---|---|---|
| RTX 3060 | 12GB | 192bit | 360 GB/s |
| RTX 5060 Ti | 16GB | 128bit | 448 GB/s |
| RTX 4070 Ti SUPER | 16GB | 256bit | 672 GB/s |
| RTX 5080 | 16GB | 256bit | 960 GB/s |
RTX 5060 Ti、RTX 4070 Ti SUPER、RTX 5080については、すべてVRAM容量が16GBです。
そのため、
「同じVRAM容量でも画像生成速度にどれくらい差が出るのか」
を見るには都合のよい比較になっています。
なお、CUDAコア数やTensor CoreなどについてはGPU世代によって性能が異なるため、単純にコア数だけで演算性能を比較できない点には注意が必要です。
筆者の環境ではAMD Radeon RX 7700 XTも使用する予定でしたが、動作が安定せず手放したため、比較から外しています。
Animaで比較する
普段使用しているAnimaの生成パターンを使い、100枚連続生成した時間を計測しました。
結果
| GPU | 100枚生成時間 | 1枚あたり | RTX 3060比 |
|---|---|---|---|
| RTX 3060 | 85分03秒 | 51.03秒 | 1.00倍 |
| RTX 5060 Ti | 47分29秒 | 28.49秒 | 約1.79倍 |
| RTX 4070 Ti SUPER | 30分48秒 | 18.48秒 | 約2.76倍 |
| RTX 5080 | 21分06秒 | 12.66秒 | 約4.03倍 |
かなり大きな違いが出ました。
特に注目したいのが、RTX 5060 Ti、RTX 4070 Ti SUPER、RTX 5080の3枚です。
これらはすべてVRAM 16GBです。しかし生成時間は、
RTX 5060 Ti 28.49秒
↓
RTX 4070 Ti SUPER 18.48秒
↓
RTX 5080 12.66秒
となりました。
RTX 5080はRTX 5060 Tiに対して、
28.49 / 12.66 ≒ 2.25
約2.25倍の生成速度です。
同じ16GBでも生成性能にはこれだけの違いがあります。
VRAM容量が多ければ高速になるわけではない
この結果から最初に分かるのは、
VRAM容量そのものと画像生成速度は別物
ということです。
RTX 5060 Ti、RTX 4070 Ti SUPER、RTX 5080はいずれも16GBです。
それにもかかわらず、生成速度には最大約2.25倍もの違いがありました。
したがって今回のAnima生成条件では、
VRAM 16GBだから同程度の生成性能
とはなりません。
VRAM容量は「どれだけ高速に計算できるか」というより、
モデルや生成処理に必要なデータをGPU上に保持できるか
という役割が大きいと考えた方が分かりやすいです。
VRAM帯域はどうなのか
次にVRAM帯域を比較します。
| GPU | VRAM帯域 | RTX 3060比 | 実測生成速度比 |
|---|---|---|---|
| RTX 3060 | 360 GB/s | 1.00倍 | 1.00倍 |
| RTX 5060 Ti | 448 GB/s | 約1.24倍 | 約1.79倍 |
| RTX 4070 Ti SUPER | 672 GB/s | 約1.87倍 | 約2.76倍 |
| RTX 5080 | 960 GB/s | 約2.67倍 | 約4.03倍 |
VRAM帯域が増えるほど生成速度も向上しています。
そのため、VRAM帯域が画像生成性能に影響していることは十分考えられます。
ただし、完全なVRAM帯域律速ではなさそうです。
RTX 3060からRTX 5080ではVRAM帯域が約2.67倍なのに対して、実際の生成速度は約4.03倍になっています。
つまりVRAM帯域だけでは、この性能差を説明できません。
GPU演算性能も重要
画像生成AIでは大量の行列演算が実行されます。
そのため、
- CUDAコア
- Tensor Core
- FP16/BF16/FP8などの低精度演算性能
- GPUアーキテクチャ
- Attentionなどを処理するカーネル
といったGPU側の能力も重要になります。
今回の結果でも、新しい上位GPUほど大幅に生成速度が向上しています。
一方でGPU世代が異なるため、
CUDAコアが2倍
↓
画像生成も2倍
という単純な比較はできません。
GPU演算性能とVRAM帯域の両方が向上しているため、今回の実測だけから両者の寄与率を完全に分離することもできません。
そのため今回の結果については、
GPU演算性能とVRAM帯域の双方が画像生成速度に大きく影響している
と考えるのが妥当でしょう。
Krea2でも比較してみる
別のモデルとしてKrea2でも計測しました。
こちらは20枚生成した結果です。
VRAM 12GBのRTX 3060ではRAMへオフロードしながら動作するように、StableDiffusion forge neoの起動オプションに"--reserve-vram 2"を指定して計測しています。
| GPU | 20枚生成時間 | 1枚あたり | RTX 3060比 |
|---|---|---|---|
| RTX 3060 | 19分38秒 | 57.80秒 | 1.00倍 |
| RTX 5060 Ti | 11分25秒 | 34.25秒 | 約1.69倍 |
| RTX 4070 Ti SUPER | 7分47秒 | 23.35秒 | 約2.48倍 |
| RTX 5080 | 5分16秒 | 18.80秒 | 約3.07倍 |
Krea2でもAnimaと同じ順位になり、RTX 5080が最速、次いでRTX 4070 Ti SUPER、RTX 5060 Ti、RTX 3060となりました。
RTX 3060とRTX 5080を比較すると、1枚あたりの生成時間は57.80秒から18.80秒まで短縮され、RTX 5080は約3.07倍高速でした。
生成速度の差は、
34.25 / 18.80 ≒ 1.82
となり、RTX 5080が約1.82倍高速でした。
また、同じ5060 Tiと5080の比較でもAnimaとは倍率が異なります。
Anima
RTX 5080 ≒ 2.25倍
Krea2
RTX 5080 ≒ 1.82倍
これは使用するモデルによってGPU性能の活かされ方が異なることを示唆しています。
モデル構造、Attention、テキストエンコーダ、VAE、CPU処理、メモリ転送、使用するカーネルなどによってボトルネックが変わるためです。
したがって、実際に使用するモデル・解像度・生成設定によって性能差が変化すると考えた方がよさそうです。
では、VRAM容量・帯域・演算性能のどれが重要なのか
今回の結果だけから考えると、モデルがVRAMに収まっている状態での生成速度への影響は、おおむね次のように考えられます。
GPU演算性能 ≳ VRAM帯域 >>> VRAM容量
ただし、これは**「VRAM容量が重要ではない」**という意味ではありません。
VRAM容量には、演算性能や帯域とは違う役割があります。
VRAM容量は「足切り条件」と考える
画像生成AI用GPUを考える場合、VRAM容量は次のように考えると分かりやすいです。
使用したいモデル
│
▼
必要VRAMに収まる?
/ \
YES NO
│ │
▼ ▼
GPU上で処理 オフロード等が必要
│ │
▼ ▼
演算性能・帯域 大幅に低速化する
が速度を左右 可能性がある
必要量が10GBの処理に対して16GBのGPUを使っているのであれば、VRAMを24GBや32GBに増やしただけで画像生成が高速になるわけではありません。
しかし20GB必要なモデルに16GB GPUを使用すれば、CPU RAMへのオフロードなどが発生する可能性があります。
この場合は状況が逆転します。
VRAM容量不足そのものが最大のボトルネックになり得ます。
つまりVRAM容量は、「多ければ多いほど高速」という性能指標ではなく、必要量を満たしているかという条件として見るのがよさそうです。
画像生成AIでの重要度を整理する
モデルがVRAMに収まっている場合
生成速度については、
1. GPU演算性能
2. VRAM帯域
3. VRAM容量
ただし1と2は密接に関係しており、今回の実測だけから完全に切り分けることはできません。
GPU演算性能とVRAM帯域の両方を見る必要があります。
一方、VRAM容量については必要量を超えた分が直接生成速度向上につながる可能性は低いと考えられます。
VRAMに収まらない場合
こちらは順位が大きく変わります。
1. VRAM容量
2. GPU演算性能
3. VRAM帯域
というより、必要VRAM容量を満たしていることが大前提になります。
その条件を満たした後に演算性能と帯域を比較するべきでしょう。
所有している4枚のおすすめ順
今回の実測結果を前提に、所有している4枚の中から画像生成に使うGPUを選ぶなら、おすすめ順は次のとおりです。
| 順位 | GPU | VRAM | Anima(1枚あたり) | RTX 3060比 | 評価 |
|---|---|---|---|---|---|
| 1位 | RTX 5080 | 16GB | 12.66秒 | 約4.03倍 | 最優先 |
| 2位 | RTX 4070 Ti SUPER | 16GB | 18.48秒 | 約2.76倍 | 十分高速 |
| 3位 | RTX 5060 Ti | 16GB | 28.49秒 | 約1.79倍 | VRAM容量は同じだが速度は劣る |
| 4位 | RTX 3060 | 12GB | 51.03秒 | 1.00倍 | 4枚の中では最も遅い |
1位:RTX 5080
今回の環境では、RTX 5080が明確に最速でした。
Animaでは12.66秒/枚、Krea2でも18.80秒/枚という結果です。Animaで100枚生成した場合の所要時間は、次のようになりました。
| GPU | 100枚生成時間 |
|---|---|
| RTX 3060 | 約85分 |
| RTX 5060 Ti | 約47分 |
| RTX 4070 Ti SUPER | 約31分 |
| RTX 5080 | 約21分 |
大量に生成するほど、この時間差が効いてきます。処理速度を最優先するなら、RTX 5080が第一候補です。
2位:RTX 4070 Ti SUPER
今回の結果で注目したいのがRTX 4070 Ti SUPERです。
RTX 5060 Tiと同じ16GBでありながら、Animaの生成時間は次のようになりました。
RTX 5060 Ti 28.49秒
↓ 約1.54倍高速
RTX 4070 Ti SUPER 18.48秒
両方を所有している場合、「RTX 5060 Tiの方が新しい世代だから」という理由だけで優先するメリットは薄く、生成速度を重視するならRTX 4070 Ti SUPERを選ぶ方が合理的です。
3位:RTX 5060 Ti 16GB
生成速度ではRTX 4070 Ti SUPERに及びませんが、16GBのVRAMを搭載していることには意味があります。
RTX 3060より約1.79倍高速で、VRAM容量も12GBから16GBに増えるため、RTX 3060よりVRAM使用量の多いモデルや生成条件に対応しやすくなります。
今回の4枚の中では、次のような位置付けです。
最速ではないものの、16GBのVRAMを確保できる画像生成用GPU
4位:RTX 3060 12GB
AnimaではRTX 5080との差が約4倍あるため、生成速度を重視する場合、メインの画像生成GPUとして積極的に選ぶ理由は少なくなります。
ただし、これはRTX 3060が画像生成に使えないという意味ではありません。12GBのVRAMがあるため、サブの生成環境、別ジョブの並列実行、LLMや画像生成の実験環境として活用できます。
新しくGPUを購入するなら何を優先するか
今回の結果を踏まえると、画像生成AI用GPUを新しく購入するときは、単純に「一番VRAMが多いGPU」でも「一番演算性能が高いGPU」でもありません。
1. 最初に必要なVRAM容量を決める
筆者の感想としては、画像生成AIでは10GB以下だとVRAM不足で動作しないモデルも多く、VRAM16GB以上のGPUを選ぶことが無難と考えています。
ただし、RTX3060でもメインメモリにオフロードされるよう、メモリを32GB搭載し、StableDiffusion forge neoの起動オプションに"--reserve-vram 2"のような設定を入れることにより、VRAM不足を回避することも可能でした。
実測として以下のモデルで何も指定しない場合、以下のVRAM使用量になりました。
| モデル | VRAM使用量 |
|---|---|
| Illustrias | 6GB |
| Anima | 9.0GB |
| Krea2 | 13.5GB |
2. 必要容量を満たしたGPU同士で演算性能を見る
必要VRAM容量を満たしたら、次にGPU自体の演算性能を比較します。
画像生成AIではTensor演算などが大量に実行されるため、ここが実際の生成時間に大きく影響します。
今回も同じ16GBで、
RTX 5060 Ti 28.49秒
RTX 4070 Ti SUPER 18.48秒
RTX 5080 12.66秒
という大きな差が出ています。
特に初めての生成で試しで使うなら5060Tiでも十分ですが、後から生成速度を重視するなら4070 Ti SUPERや5080を選ぶ方がよいでしょう。
3. VRAM帯域も確認する
同クラスで迷った場合はVRAM帯域も重要です。
LLMも利用していく場合、予算が許せばRTX 4070 Ti SUPERやRTX 5080のようにVRAM帯域が広いGPUを選ぶ方が、生成速度の向上につながる可能性があります。
特にGPU演算性能が高くても、メモリから十分な速度でデータを供給できなければGPUを活かし切れません。
したがって、
必要VRAM容量
↓
GPU演算性能
+
VRAM帯域
↓
価格・消費電力
という順番で候補を絞る方法がよいと考えています。
まとめ
今回、RTX 3060、RTX 5060 Ti、RTX 4070 Ti SUPER、RTX 5080を使って画像生成時間を比較しました。
AnimaではRTX 3060の51.03秒/枚に対して、RTX 5080では12.66秒/枚となり、約4倍の生成性能になりました。
また同じ16GBのRTX 5060 Ti、RTX 4070 Ti SUPER、RTX 5080でも大きな性能差が確認できました。
この結果から、画像生成AIにおけるGPU選びでは、「VRAM容量だけを見て選ぶ」のは適切ではないと考えています。
ただしVRAM容量が不足すると、GPU演算性能以前の問題になります。
そのため新しくGPUを購入する場合は、
① 使用したいモデルに必要なVRAM容量を確保する
→VRAM 16GB以上が無難
↓
② 条件を満たすGPUから演算性能を比較する
→RTX 5060Tiでも十分だが、RTX 4070 Ti SUPERやRTX 5080の方が高速
↓
③ VRAM帯域も比較する
→RTX 5060Tiでも十分だが、RTX 4070 Ti SUPERやRTX 5080の方が高速
↓
④ 価格・消費電力を含めてPC構成を最終決定する
*上記とは別のメインメモリは32GB以上あると、生成中のCPU処理やオフロードが安定します。
*CPUについては特に画像生成には影響ないため、GPUとのバランスや他の利用目的に応じて選択してください。
*CPUは内蔵グラフィックのあるCPUをお勧めします。(GPU障害の切り分けにも利用可能)
という選び方がよさそうです。
一言でまとめるなら、
VRAM容量は「どこまでできるか」を決め、GPU演算性能とVRAM帯域は「どれだけ速くできるか」を決める。
今回の実測結果を見る限り、画像生成AI用GPUを選ぶ上では、この考え方が一番実態に近いのではないかと思います。
追伸>
Anima/Krea2のような画像生成AIは、DDR4/DDR5メインメモリも32GB以上あれば、生成中のCPU処理やオフロードが安定する印象です。(Krea2は32GB載せないと画像生成できませんでした。)
筆者の環境では64GBを搭載していますが、32GBでも十分だと思います。
注意
今回の結果は、筆者の環境および特定のAnima・Krea2生成条件で計測したものです。
画像生成AIの性能は、
- 使用モデル
- 解像度
- Steps
- Sampler
- 精度(FP16/BF16/FP8など)
- Attention実装
- PyTorch/CUDAバージョン
- WebUI
- GPUドライバ
- CPU/RAM
- オフロード設定
などによって変化します。
そのため、本記事の結果を各GPUの絶対的な性能差として扱うのではなく、実際の画像生成環境における一つの実測例として参考にしてください。
正直なところ、私の環境でのゲーム利用ではRTX3060とRTX 5080の差は体感しにくいですが、画像生成AIではこの差が大きく出ることを実感しました。