RTX PRO 4500 Blackwell Workstation Editionの32GB VRAMは、1枚のGPUに置けるLLMの重みと実行時メモリを増やします。「32GBなら何パラメータまで動くか」は、重みの精度だけで決まりません。トークンを保持するKVキャッシュ、コンテキスト長、同時実行数、推論ソフトのバッファも同じVRAMを使います。モデル規模ごとの計算と、容量が使われる順序を整理します。
32GBの内訳
NVIDIA公式データシートは、このカードを32GB ECC対応GDDR7、メモリ帯域幅896GB/秒としています。GPUの表示上の空き容量は、OSやGPUドライバー、推論プロセスの確保分を除いた値です。重みの理論サイズが32GB未満でも、空き領域を全部重みに割り当てられるわけではありません。
| モデル規模 | 重みだけの単純計算 | 実際に加わるもの |
|---|---|---|
| 7B、FP16 | 約14GB | KVキャッシュ、実行バッファ |
| 27B、4ビット | 約13.5GB | 量子化の付帯情報、KVキャッシュ |
| 70B、4ビット | 約35GB | 重みだけで32GBを超える |
表は1パラメータ当たりFP16を2バイト、4ビットを0.5バイトとして掛けた概算です。実際のモデル形式には尺度値などの付帯情報があり、容量はファイル形式によって変わります。27Bの4ビットモデルなら重みの単純計算は約13.5GBなので、32GB内にキャッシュや実行バッファを置く余地があります。70Bの4ビットモデルは重みだけで約35GBとなり、1枚の32GBへ全量を載せる構成には収まりません。
コンテキスト長と同時実行数
LLMは入力文と過去の生成結果を処理するためにKVキャッシュを確保します。必要量はモデルの層数、KVヘッド数、キャッシュの精度、コンテキスト長、同時に走らせる会話数に依存します。重みが同じでも長い文書を読み込む設定や複数セッションの同時処理では、重み以外のVRAMが増えます。
たとえば27Bの4ビット重みが約13.5GBでも、「残り約18.5GBをすべて長文入力に使える」という計算にはなりません。量子化の管理情報とランタイムのワークスペースが先に必要です。使えるコンテキスト長は、モデルの公称上限に加え、KVキャッシュへ割けるVRAMで決まります。実際の搭載可否は使うモデル形式と推論エンジンのメモリ割り当てで決まります。
FP16モデルとの容量差
同じ27BモデルをFP16で置くと、重みだけで約54GBになります。4ビットの約13.5GBとは40GB以上の差があり、量子化の選択が32GBへの収まり方を大きく変えます。13BのFP16重みは単純計算で約26GBです。32GBとの差は約6GBで、そこからKVキャッシュや実行バッファを確保します。長いコンテキストや同時実行を増やす構成では、この余白が先に埋まります。
ここに示した数値はパラメータ数に1個当たりのバイト数を掛けた重みの概算です。モデルの層構成や配布形式ごとの付帯データまで含む実使用VRAMは、この表の値と異なります。
帯域幅と生成速度
896GB/秒は、ELSAの国内仕様書にも載る公式帯域幅です。推論中にGPUが重みを繰り返し読む処理では、帯域幅が性能に関係します。一方、最初のトークンが出るまでの時間と、2トークン目以降の生成速度では負荷の性質が違います。Puget SystemsのMLPerf Client測定も両者を別のグラフで報告しており、一つのAI TOPS値から両方を求めていません。
NVIDIAのデータシートにある1,617 AI TOPSは、FP4とスパース性を使うピーク値です。LLMがその演算形式を使わない場合や、メモリ転送が律速になる場合には同じ値を出せません。モデル形式、推論エンジン、バッチ設定が異なる記事のトークン毎秒を単純に横並びにすることもできません。
他の容量帯との境界
同シリーズのRTX PRO 4000 Blackwellは24GB、RTX PRO 5000 Blackwellは48GBまたは72GBです。32GBは24GBでは収まらないモデルや長い文脈を一枚で扱える余地を広げます。48GB以上のカードはさらに大きい重みやキャッシュをGPU内に残せます。容量の境界をまたがないワークロードでは、GPUの演算・帯域や価格の比較が中心になります。
複数GPUに分ける推論方式やCPUメモリへのオフロードもあります。その場合、CPUとGPU間の転送やモデル分割の仕組みが処理速度に影響します。RTX PRO 4500 BlackwellはPCIe 5.0 x16ですが、GPU内896GB/秒とPCIe経由の転送は同じ速度ではありません。
32GBで得られる余地
32GBの価値は「27Bの4ビット重みが入る」といった単一の境界だけではありません。モデル本体、KVキャッシュ、推論バッファを同じGPUに残しやすくなる点にあります。70Bの4ビット重みは単純計算でも32GBを超え、別の構成が必要です。GPUの200W設計とECC対応を含めた製品全体の仕様は性能と仕様の記事で整理しています。
