32GB同士のLLM比較
AMDの製品仕様ではRadeon AI PRO R9700は32GBのGDDR6と640GB/sの帯域を備えます。NVIDIAのRTX 5090仕様も32GB GDDR7を掲載しています。モデルがメモリ内に入るかだけなら同じ容量ですが、実際の推論速度は帯域に加えてGPU演算器、推論ソフト、ドライバー、量子化形式にも影響されます。
| 比較項目 | Radeon AI PRO R9700 | GeForce RTX 5090 |
|---|---|---|
| VRAM | 32GB GDDR6 | 32GB GDDR7 |
| メモリ帯域 | 640GB/s | 1,792GB/s |
| 公称ボード電力 | 300W | 575W |
| 主なソフトウェア環境 | ROCm、Vulkanなど | CUDA、Vulkanなど |
容量が同じでもデータを読み書きする速さは同じではありません。長い文書やコードをプロンプトとして与えるときと、モデルが応答を生成するときもGPUへの負荷が異なるため、LLM比較は一つの速度値だけで結論を出さないことが大切です。
公開された同一モデルの比較
llama.cppの開発コミュニティでは、Qwen3.5-35B-A3BのQ4_K_XLを使ってRTX 5090とR9700を比較した実測が公開されています。トークン生成はRTX 5090が194.0tok/s、R9700が127.4tok/s。入力処理は512トークン時に7,026対2,713tok/s、32,768トークン時に6,461対1,877tok/sでした。
この結果では、RTX 5090は入力処理の差が大きく、生成速度も約1.5倍でした。長いコンテキストを頻繁に渡す検索拡張生成やコーディング支援では、ユーザーが入力してから最初の返答が出るまでの時間が比較の焦点になります。応答を読み進める速度だけでなく、長い素材を読み込む時間も測って選びましょう。
公開テストは同じ測定機材を入れ替えた比較ではありません。RTX 5090側はRyzen 9 9900XとCUDA 13.0、R9700側はRyzen 5 7500FとVulkanで、量子化モデルは約19GB、両方とも全レイヤーをGPUへ配置した設定です。結果は利用環境を考える参考であり、あらゆるモデルで同じ倍率になるとは示していません。
速度と容量の選び分け
短い応答を高い速度で得たい、CUDA対応ツールを中心に使いたい、長いプロンプトの前処理時間を減らしたい用途はRTX 5090が有利です。公開ベンチでも同一モデルの生成とプロンプト処理で5090が上回っています。R9700は32GBの容量を一枚で確保しつつ、RTX 5090より購入費を抑えたいローカルAI用途に候補になります。Puget Systemsの測定では、R9700二枚で合計64GBのVRAMを用意する構成も試しています。
二枚構成は容量を増やせますが、対応フレームワーク、マザーボードのPCIeスロット、電源と冷却も必要です。容量だけでなく、使うモデルが32GBに収まるか、生成速度とプロンプト処理のどちらを重視するかを先に整理してください。VRAM内に収まるモデルの目安は32GBで動かせるLLMの記事、R9700単体のvLLM実測は単体ベンチマーク記事で確認できます。
ベンチマークの見方
GPUの公称メモリ帯域だけから、LLMの速度を正確に予測することはできません。デコードでは重みデータの読み込みが大きな要因になりますが、プロンプト処理は演算やカーネル実装の影響が強く出ます。MoEのように一部の専門家だけを計算するモデルでは、総パラメーター数と実際に一トークンを処理する負荷も別です。
購入前には、使いたいモデル名、量子化、長文入力の長さ、利用者数をそろえた比較値を探します。R9700と5090を比較した元データには異なるCPUとバックエンドが使われているため、その違いも含めて評価します。SDXLなど画像生成の速度を比べる場合はLLM結果と分け、ComfyUIの比較条件を確認してください。
推論時の入力処理と生成処理
同じLLMでも、質問文を読み込むprefillと、回答を一語ずつ出すdecodeは別の処理です。短い質問で対話する場合はdecodeの待ち時間が目立ち、ソース一式を与えるコーディング支援ではprefillが先に時間を使うことがあります。公開比較でRTX 5090がとくに大きく差を付けたのはprefillで、長いコンテキストほど差が広がっています。
RTX 5090の大きなメモリ帯域は、重みを連続して読み込む生成処理にも関係します。R9700はモデルをVRAMへ収める容量と価格を優先する候補ですが、同じQ4モデルが両方で起動したあとに、どの程度の待ち時間を許容できるかを利用者自身のプロンプトで確かめましょう。二枚構成へ進む場合は、単体の実測と異なる並列化条件になるため、64GB構成の記事の数値を参照してください。
