2枚で増える64GBのVRAM
Radeon AI PRO R9700を2枚搭載すると、カードごとに32GB、合計64GBのVRAMを使えるLLM構成を組めます。Puget Systemsは2枚のR9700をワークステーションに搭載し、単体GPUの基準値に加えて、vLLMのTensor Parallelismとllama.cppのレイヤー分割を測定しました。1枚では余裕が小さい27B級モデルを、複数のGPUへ分散して扱う方法を検証しています。
二枚挿すだけで、OSから一つの連続した64GB VRAMとして見えるわけではありません。モデルや中間データをカード間に分けるには、推論ソフト側の並列化方式が必要です。Tensor Parallelismは計算対象をGPU間で分配し、レイヤー分割はモデルの層をカードごとに割り当てます。利用予定のフレームワークと量子化形式が、複数GPUの分割に対応しているか先に確認しましょう。
Qwen3.6-27Bの実測
Pugetのテストでは、Qwen3.6-27BをFP8で読み込み、vLLMのTensor Parallelismを2に設定しました。標準vLLMでは同時利用1人で15.88tok/s、4人で69.34tok/s、8人で156.21tok/sの合計スループットでした。チューニング済みvLLMでMulti-Token Predictionを有効にした設定では、1人で62.75tok/s、8人で320.23tok/sまで上がっています。
| 2枚構成の方式 | 同時利用数 | 総スループット | GPU電力(両カード) |
|---|---|---|---|
| 標準vLLM、FP8、TP=2 | 1 | 15.88 tok/s | 310W |
| 標準vLLM、FP8、TP=2 | 8 | 156.21 tok/s | 480W |
| Tuned vLLM、FP8、TP=2、MTP | 1 | 62.75 tok/s | 315W |
| Tuned vLLM、FP8、TP=2、MTP | 8 | 320.23 tok/s | 490W |
| llama.cpp、Q4_K_M、レイヤー分割 | 8 | 56.00 tok/s | 353W |
測定は500入力トークン、200出力トークン、50個のプロンプトを使い、2枚のカードを載せたLinuxのベアメタル環境で実施されました。同時利用8人で示された320.23tok/sは全リクエストの合計値で、一人のユーザーが毎秒320トークンを受け取る意味ではありません。標準vLLM、最適化ビルド、llama.cppでは結果が異なり、複数GPUの性能がソフトウェアの実装に強く左右されることも分かります。
Tensor Parallelismと実行環境
Puget Systemsは標準vLLMのTP=2構成でRCCLの初期化を確認し、PCIe経由のP2P/IPC通信を使って推論を行っています。仮想化環境のGPUパススルーでは同じように通信できない事例もあり、ベンチマークはLinuxのベアメタル上で測定されています。仮想マシンやコンテナへGPUを割り当てる場合は、ホストOS、ドライバー、GPU間通信がそれぞれ認識されるか検証します。
推論フレームワークはモデルの読み込み後にGPUごとのメモリを確保します。32GB×2という合計容量のほか、コンテキスト長やKVキャッシュに必要な領域も見ます。高精度のモデルや長文を扱うためにメモリを増やしても、シングルユーザーの生成速度やプロンプト処理が比例して速くなるわけではありません。性能を判断するには、自分が使うモデル、同時リクエスト数、入力の長さをそろえた測定を行います。
マザーボードと電源の条件
AMDの仕様ではR9700は1枚当たり300W TBPで、2枚のGPU分は合計600Wになります。これにCPU、メモリ、ストレージなどの電力が加わるため、単体構成向けの750W推奨をそのままデュアルGPU環境へ使うのではなく、全体構成から電源容量を計算します。PugetはThreadripper PRO、128GBのシステムメモリ、ワークステーション用マザーボードを使用しました。
マザーボードのPCIeスロット配置、レーン数、カード同士の距離、ケースの排熱も必要です。R9700の販売モデルによって厚みや排気方法が異なり、二枚を挿すと隣接スロットを塞ぐ場合があります。組み立て前にカードの仕様表を確認し、電源のコネクタ数、ケーブルの経路、CPUクーラーやケースファンも含めて構成を確定します。
1枚との違いと導入判断
一枚の32GBに収まるモデルを一人で使うなら、二枚構成の購入費と消費電力を追加する理由は、容量不足か同時リクエスト処理にあるかを見極めます。Pugetの同時利用テストでは標準vLLMのスループットが利用者数に合わせて伸びました。単一ユーザー向けには、モデルや設定を絞った単体構成のベンチマークも比べてください。
R9700一枚に収まるモデルのサイズと量子化は32GB容量の解説で、単体カードのvLLM結果はLLMベンチマーク記事で紹介しています。電源容量と12V-2x6配線は電源ガイド、ローカルLLM用途でのRTX 5090との違いは比較記事をご覧ください。
