RTX PRO 4000 Blackwellの24GBで、使いたいローカルLLMは動くのでしょうか。モデルの名前やパラメータ数だけでは答えは決まりません。重みの実サイズと会話中に増えるメモリを合わせて見ると、GPUの容量を活かせます。

24GB ECCメモリの位置づけ

NVIDIAの製品仕様は24GBのECC付きGDDR7と672GB/sの帯域幅を示しています。ECCはメモリ上の一部の誤りを検出・訂正する仕組みで、長く動かす仕事向けの特徴です。推論ではモデルの重みをGPUメモリへ置けると、CPU側とのデータの行き来を減らしやすくなります。実際の空き容量は24GBから実行ソフト、画面表示、計算バッファが使う分を差し引いて見積もります。

最初に見るべき数字は、配布されるモデルファイルの実サイズです。「30B」はおおよそのパラメータ数を表します。単純計算では30Bの重みを4bitで保存すると約15GBになります。実際の量子化形式にはスケールなどの情報が加わり、推論には作業領域も必要です。ファイル容量に加え、KVキャッシュと作業領域を見込んで起動条件を判断します。

4bitで重みだけを保存した場合の理論量は、8Bで約4GB、30Bで約15GB、70Bで約35GBです。70B級は重みの理論量だけで24GBを超えます。30B級なら残りをKVキャッシュなどへ配分できる見込みがありますが、実際の量子化ファイルの大きさと起動ログで確かめます。この概算は、候補モデルを絞るための最初の計算です。

KVキャッシュと会話の長さ

LLMは入力した文脈を参照するため、推論中にKVキャッシュを確保します。llama.cppのサーバー設定にはコンテキスト長、並列処理数、キャッシュの形式や配置を変える項目があります。短い質問を一人で試す場合と、長文資料を数人が同時に使う場合では、同じモデルでも必要なメモリが変わります。会話の最大長と同時利用者数は、導入前に決めておくとモデル選びが進みます。

実用的な進め方は、短いコンテキストでモデルを起動し、ログに出るGPU割り当て量を確認することです。その後、必要な長さまで少しずつ増やします。並列利用を予定するなら、一人分の長い会話でメモリを測ってから同時実行数を増やします。VRAMに収まらずCPUへ処理が回ったときはGPU使用量と応答時間を記録し、容量と速度の影響を切り分けます。

量子化とオフロード

同じモデルの複数量子化版を比べると、重みを小さくするほどKVキャッシュへ残せる領域が増えます。ただし精度形式は出力にも関わります。使う日本語の質問や要約文をいくつか固定し、候補形式で結果と回答速度を並べると選択しやすくなります。最大パラメータ数を追うだけでは、必要な回答品質と待ち時間のバランスが見えません。

llama.cppではGPUへ置くレイヤー数やキャッシュの配置を調整できます。モデル全体が24GBに収まらない場合は、一部をCPUメモリへ置く運用もあります。CPUへ頻繁にデータが渡ると速度が落ちます。NVIDIAデータシートのPCIe 5.0 x16は接続の帯域を示します。実際のトークン速度はモデル、量子化、CPU側との転送量で変わります。容量、コンテキスト長、速度のどれを優先するかで構成を決めます。

ワークステーションの構成

通常版はフルハイトで長さ9.5インチのカードです。24GBのGPUメモリが足りても、ケースのカード長、空冷の吸排気、16ピン補助電源の取り回しは別の条件になります。常時稼働ならシステムメモリと保存用SSDの容量も重要です。複数モデルを保存して頻繁に切り替える場合、SSDの空き容量と読み込み時間が運用に効きます。GPUだけを交換する予定なら、先にケースと電源の条件を確認してください。

まとめ

24GB ECCメモリは、量子化したモデルと文脈の長さを調整して使うローカルLLM構成に向きます。モデルファイル、KVキャッシュ、作業領域、同時実行数を合わせて容量を見積もってください。一つの候補でGPUメモリ使用量と回答速度を測れば、より大きなモデルへ進める余地も判断できます。