単体カードの生成速度
Radeon AI PRO R9700のLLM性能を比べるときは、モデル名だけでなく、バックエンド、量子化、入力文の長さ、同時ユーザー数を合わせて読む必要があります。Puget Systemsの測定では、R9700単体を使いvLLM上でFP16モデルの生成を検証しています。公開された表では、8Bモデルが1ユーザー利用で毎秒27.7〜34.5トークン、3Bモデルが毎秒53.3トークンでした。
| モデルと設定 | 1ユーザーの総スループット | TTFT | ITL |
|---|---|---|---|
| Qwen2.5 3B Instruct FP16 | 53.3 tok/s | 60ms | 19ms |
| DeepSeek-R1-Distill-Llama-8B FP16 | 34.5 tok/s | 111ms | 29ms |
| Llama 3.1 8B Instruct FP16 | 29.1 tok/s | 113ms | 34ms |
| Qwen3 8B FP16 | 27.7 tok/s | 92ms | 36ms |
この測定は500入力トークン、500出力トークン、単一R9700、コンテキスト上限16,384で実施されています。ベンチマーク用の条件をそろえた数値なので、異なるモデルの一般的な回答速度をそのまま示すものではありません。Qwen3は推論を含むモデルのため、テスト側は測定時間を延ばしています。
トークン速度の読み方
LLMベンチマークで「tokens/s」と書かれる値には、生成したトークンを数えるデコード速度と、入力プロンプトを読み込む速度があります。利用者が一人で会話するときは、応答中の表示速度と最初の返答までの時間が体感を左右します。複数の利用者へ同時に応答するサーバーでは、一定時間に全利用者へ出せる総スループットが重要です。
Pugetの表でも、Qwen2.5 3B Instructは同時利用を1人から4人に増やすと、総スループットが53.3から183tok/sに伸びました。8人では251tok/sです。Qwen3 8Bは1人で27.7tok/s、4人で104tok/s、8人で157tok/sでした。利用者数を増やすと合計処理量は上がりますが、各リクエストの待ち時間も増えるため、一人あたりの速度として251tok/sが出るわけではありません。
27B級モデルの容量と速度
R9700を選ぶ理由は、8Bモデルで最速を狙うことより、VRAM 32GBを使ってより大きなモデルや量子化を選べる点にあります。Back2Gamingのレビューは27BモデルをR9700のVRAMへ置いた検証も行い、GPU消費電力を計測しています。実測の比較では、モデルがVRAM内に収まることと、毎秒の生成速度を別の軸として扱っています。
27B、32Bというパラメーター数だけでは結果を決められません。MoEモデルでは1トークン当たりに演算する有効パラメーター数が少ない場合があり、Q4やQ6などの量子化方法でも重み容量と演算負荷が変わります。前段のプロンプト読み込みと、返答を一語ずつ生成する速度も別々に計測されます。候補モデルごとに推論ソフトとバックエンドの同じ条件の数値を探してください。
ベンチマークの比較条件
ベンチマーク表を見比べる際は、次の条件をチェックします。
- モデルと量子化:同じパラメーター数でもQ4、Q6、FP16ではファイル容量と精度が異なる。
- プロンプト長:長い入力は最初の返答までの待ち時間に影響する。
- 測定バックエンド:ROCm、Vulkan、Windows用の推論ランタイムで結果が異なる。
- 利用者数:総スループットが一人用の生成速度と混同されていないかを見る。
- VRAMに収まるか:CPUオフロードや別GPUへの分割があるかを確認する。
AMDの製品仕様では32GBのGDDR6と640GB/sのメモリ帯域が示されています。これらは処理環境を理解する基礎情報であり、実際のtok/sはモデルやソフトの実装が加わって決まります。レビュー値を読む前に32GBに収まるLLMの考え方を押さえると、容量と速度を切り分けて検討できます。
目的別の判断
一人で短いチャットをするなら、TTFTとITLが小さく、希望するモデルがVRAM内で動く構成を優先します。社内の複数ユーザーへ配信する場合は、同時リクエスト数を含む総スループットを基準にし、ピーク時の待ち時間も測ります。自分の入力文を使って試せるモデルが公開されていれば、同じ入力と生成長で複数バックエンドを比較しましょう。
RTX 5090との比較では、モデルにより単体の生成速度と入力処理速度に差があります。今回のPuget測定は主にAMD側のLLMベンチマークなので、競合との数字を直接比べたい方はRTX 5090との比較記事もご覧ください。大きなモデルを複数カードに分ける場面では、デュアルGPUの測定条件も速度の判断材料になります。
同じ条件で測る手順
購入後に手元の環境を評価する場合は、使うモデルファイルのハッシュ、量子化名、推論バックエンド、入力トークン数、出力上限、コンテキスト長を保存します。GPUの温度が安定するまでウォームアップし、同じプロンプトを複数回処理した平均と最小値を記録すると、一度だけ速く出た結果に判断を引きずられません。
対話用では、最初のトークンが届くまでの時間と生成中のtokens/sを個別に測定します。複数利用者向けでは、想定する同時リクエスト数を設定し、総スループットと各リクエストの待ち時間を併記します。こうすると自分の用途に対して必要な容量と速度が分かり、同じモデルの条件を揃えたGPU比較へつなげられます。
