RX 9070 XTは16GBのVRAMを備えます。ローカルLLMを選ぶとき、GPUに収まるかは、モデルの規模と量子化形式で変わり、会話を続けるにはKVキャッシュも必要です。Qwenが配布するGGUFファイルを例に、16GBカードでモデルを選ぶ基準を整理します。
8B・14B・32Bのファイル容量を比べる
AMDのRX 9070 XT仕様ではVRAMは16GBです。Qwen公式のQ4_K_M形式GGUFを見ると、Qwen3-8Bは5.03GB、Qwen3-14Bは9GB、Qwen3-32Bは19.8GBです。最後の32Bは重みファイルだけで16GBを超えます。この形式の32Bを単体のRX 9070 XTに全量載せることはできません。
| Qwen公式GGUF | Q4_K_Mファイル容量 | 16GBカードでの最初の判断 |
|---|---|---|
| Qwen3-8B | 5.03GB | 余裕を残して試しやすい |
| Qwen3-14B | 9GB | 文脈とほかの使用量を見て検討 |
| Qwen3-32B | 19.8GB | 単体GPUへ全量は収まらない |
表の値はファイルの配布容量です。実際のGPU使用量には計算用の領域とKVキャッシュが加わります。画面表示やブラウザーなど、同じGPUを使うアプリの分だけ自由に使えるVRAMも減ります。使うアプリが表示する見積もりと実測値を確認してください。
量子化と文脈長をどう決めるか
Q4_K_MはQwenが配布する量子化形式の一つです。量子化を強めると重みファイルを小さくできますが、回答の性質が変わる場合があります。まず同一モデルのQ4_K_Mで動作と速度を見て、必要な品質に応じて別の量子化を比べます。同じモデルの別の量子化版で、用途に合う回答品質と速度を確かめます。
文脈長は会話で参照するトークン数の上限です。OllamaのFAQは文脈長を変更できることを案内しています。LM Studioの読み込み資料にも文脈長の指定と、読み込み前のメモリ見積もりがあります。長い資料を入れる用途では文脈を増やす必要がありますが、その分KVキャッシュの消費量も変わります。初回は短い文脈でモデルを読み込み、実際の用途に必要な長さまで段階的に増やします。
用途ごとの選び方
短い質問や文章の下書きなら、8B級のQ4モデルから始めると、GPUに載るかどうかの切り分けが容易です。長めの推論や指示の追従を比較したいなら14B級を同じ質問で試し、メモリ見積もりと応答速度を確認します。32B級で品質を優先する場合、19.8GBのQ4ファイルは16GBを超えるため、CPU側へ一部を置くか、複数GPUを使う構成が必要です。CPUへ層を移した構成では、GPUだけの場合と生成速度が変わります。
モデルには文脈の処理以外にも、視覚入力やツール呼び出しなど個別の機能があります。必要な機能が配布モデルとアプリの双方で利用できるかも見てください。量子化の容量だけで選んで、アプリが対応しない形式を取得すると使えません。GGUFならllama.cppや対応するGUIアプリのモデル形式と合わせて確認します。
実測を残すと買い替え判断にも使える
モデルをロードした後、Ollamaならollama psのPROCESSOR列、LM StudioならGPUオフロード表示とメモリ使用量を確認します。測定にはモデル名、量子化名、文脈長、GPUに載った割合、生成速度を一緒に記録します。設定が異なる2つの結果を単純に比較しても、カードの違いか設定の違いか分かりません。
RX 9070 XTの16GBは8Bや14BのQ4モデルを検討しやすい容量です。一方、もっと大きなモデルを常用したいなら、モデルを小さくする、CPUとの分担を許す、複数GPUに分散するなどの選択肢があります。手元のタスクで8Bと14Bの回答品質を比べると、より大きいモデルが必要か判断できます。
GPUからあふれた層をCPUへ置く場合は、システムRAMにもモデルの一部と作業領域を確保します。32BのQ4_K_Mファイルをダウンロードするだけでも約20GBの保存容量が必要です。モデルの取得前にはストレージの空きも確かめ、GPU全量配置を狙う場合とCPU併用を許す場合で、必要なRAMと目標速度を別々に見積もると構成を決めやすくなります。
モデルを二つ同時にロードする用途では、それぞれの重みとKVキャッシュが重なってVRAMを消費します。単一モデルで余裕がある構成でも、同時起動するモデルの数が増えるとGPUへの配置比率が変わります。常用するアプリでは、実際の同時起動数でメモリを測ると選びやすくなります。
まとめ
Qwen公式のQ4_K_Mファイルを基準にすると、8Bは5.03GB、14Bは9GB、32Bは19.8GBです。RX 9070 XTの16GBで全量GPU実行を狙うなら、重み以外の領域を残せる8B・14Bから試し、アプリのメモリ見積もりと実測で文脈長を決めます。
