ComfyUIで使う32GB VRAM

Radeon AI PRO R9700はGDDR6を32GB搭載し、画像生成モデルやテキストエンコーダー、生成中の作業領域をGPU側へ置きやすいカードです。ComfyUIではチェックポイントだけでなく、VAE、LoRA、テキストエンコーダー、解像度、バッチ数もメモリ使用量に関わります。大きなモデルを扱う場合、容量に余裕があることでCPUオフロードを減らし、工程を組みやすくできます。

VRAMの余裕は、同じワークフローを必ず速くするという意味ではありません。生成速度はモデルとノード、解像度、ステップ数、精度、ソフトウェアの最適化で変わります。実行時間を比べるときはモデルと設定をそろえ、初回起動のモデル読込とウォームアップ後の速度を分けて記録しましょう。

SDXLの公開ベンチマーク

AMDのROCmブログでは、R9700 32GBとROCm 7.1を使ったComfyUIのSDXL測定を公開しています。1024×1024、20ステップの設定で、初回実行は9.02秒、続く実行は約5.2秒、速度は4.6 iterations/sでした。初回はモデルのロードや初期処理が含まれ、その後は同じ環境で継続して生成した値です。

独立レビューのBack2GamingもStable Diffusion XLを1024×1024で動かし、10分間連続で生成するテストを行っています。同テストではR9700が毎分9.03枚、GeForce RTX 5070 Tiが9.84枚、Radeon RX 9070 XTが8.22枚でした。モデルやステップ、ドライバーなど各レビューの測定設定は同じではないため、AMD公式の4.6it/sとBack2Gamingの枚数を単純に並べて性能順位を決めることはできません。

二つの検証は、32GBのR9700でSDXLを扱えることと、ベンチマーク値がワークフローごとに変わることを示しています。自分の生成手順を評価する際は、モデルファイル、1024pxなどの解像度、サンプラー、ステップ数、LoRA、バッチ数を固定し、複数画像の所要時間を測ります。

ComfyUIの導入と確認

AMDのROCmブログは、ComfyUIの導入手順と実行時に起こりやすい問題の確認方法を案内しています。R9700を含むRadeonで使う場合は、最初に公式のROCm対応OSとGPU一覧を照合し、その対象に含まれるドライバーとPyTorchを組み合わせます。インストール手順の細部は更新されるため、古い動画のバージョン指定をそのまま使わず、現行のAMD手順に合わせてください。

導入後は、小さなワークフローを一つ実行してGPUが選択されているか、モデルがVRAMに読み込まれているかを確認します。ターミナルにGPU関連の警告が出ていないか、生成終了時のVRAM使用量と所要時間も記録します。ノードをまとめて増やすより、基本のSDXLワークフローが完了した後にLoRAや高解像度化を一つずつ加えると、問題が起きた位置を追いやすくなります。

複数GPUと1枚の使い方

AMDのComfyUI向け案内では、ComfyUIは基本的に一つのワークフローで単一GPUを利用し、複数GPUで処理を分担する用途には別ポートで複数のComfyUIを起動する方法を挙げています。二枚挿しただけでVRAMが一つの64GB領域に統合される設計ではないため、普段の画像生成ではまず一枚のカードにノードを割り当てるのが簡単です。

大きな動画生成や並列生成を検討している場合は、ソフト側が複数カードをどう使うかを先に確認します。LLM向けの並列化とComfyUIのワークフロー分散は同じ仕組みではありません。二枚構成でローカルLLMを動かしたい場合は64GBデュアルGPUの測定記事、AI向けLinux環境の準備はROCm対応ガイドをご覧ください。

向いている用途

SDXLを含む画像生成をGPU内で完結させたい、複数のモデルやノードを切り替えて制作したい人には、R9700の32GBが作業の余地を作ります。小さな画像を単発で生成する用途では、より安価なGPUでも必要な速度を得られる場合があります。容量に価値があるのは、モデルのサイズや複雑なワークフローが16GBなどの制限に近づくときです。

価格を検討する際は、購入前に国内販売価格と流通状況も見てください。LLMのようにモデルを読み込んで返答する用途も含め、VRAM容量の具体的な考え方は32GBで動くLLMの記事で説明しています。

ワークフロー別のメモリ確認

ComfyUIでVRAM使用量を大きく変える項目は、出力解像度、同時生成数、拡散モデル、テキストエンコーダー、VAE、LoRAです。縦横の解像度を上げると中間特徴マップの領域が増え、バッチ生成では一度に保持する画像数が増えます。これらの項目を同時に変更せず、基本の一枚生成を記録してから一つずつ変更すると容量と速度の変化が分かります。

AMDの公式ベンチは1024×1024、20 stepsという再現可能な設定を示しています。自分の作業で4Kの出力や複数フレームを扱うなら、その条件を基準にモデルのサイズやバッチ数を追加し、GPUメモリの残量を見ます。GPU使用率が低く見えても、モデルの読み込みやCPU側の処理が待ち時間を作る場合があるため、生成時間とVRAM使用量を同時に記録してください。