Arc Pro B70の32GBを使えば、ローカルLLMをどこまで動かせるのでしょうか。モデルのパラメータ数だけを見ると判断を誤ります。推論にはモデル本体に加えて、会話履歴を保持する領域、演算用バッファー、実行ソフトが確保する領域も必要です。
結論は、単体のB70は量子化した20~30B級を狙いやすいカードです。OpenVINO 2026の更新履歴でも、32GBのArc Pro B70を使った単一GPUでの20~30Bパラメータ級LLM推論に対応したと案内しています。実測値とソフトの選択を合わせて見ます。
32GBで動かすモデル規模
Intelの製品仕様は32GB GDDR6、608GB/sのメモリ帯域、256基のXMXエンジンを示しています。32GBはカード上の物理メモリ容量です。モデルのファイルサイズが32GB未満なら必ずGPU内で動く、という計算にはなりません。
たとえば27Bパラメータの重みを単純に16bitで表すと、重みだけで約54GBになります。4bitなら理論上の重み部分は約13.5GBですが、実際の量子化形式には尺度などの追加データがあり、推論時のバッファーも別に確保します。長い文章を扱うほどコンテキスト用メモリも増えます。モデル配布ページのファイルサイズと、起動後のGPU使用量を区別してください。同じ27Bでも4bitと8bitで重みの大きさが変わり、長い会話を保持するほど必要な領域が増えます。PC側のRAMを多く積んで共有GPUメモリを使える場合でも、GPU専用VRAMだけで動かす構成とは転送経路が違います。購入前は「どの量子化版を、何トークンの文脈で、同時に何人が使うか」を一組の条件にしておくと、32GBが足りるかを測りやすくなります。
Qwen3.8 27Bの実測
GIGAZINEの2026年9月の実機テストは、ASRock製B70をUnsloth Desktopとllama.cppで使い、Qwen3.8 27Bを試しています。4bit量子化版ではデコード速度23.4トークン/秒、8bit量子化版では15.9トークン/秒と報告しました。
| 同記事のテスト | 4bit量子化版 | 8bit量子化版 |
|---|---|---|
| デコード速度 | 23.4トークン/秒 | 15.9トークン/秒 |
| GPU専用VRAM使用量 | 約30.0GB | 約30.2GB |
| 共有GPUメモリ使用量 | 約1.0GB | 約1.5GB |
測定では共有GPUメモリも使われています。つまり、この実行条件を「32GBのVRAM内に全処理が収まった」と紹介するのは正確ではありません。共有メモリはPC側のRAMを借りる経路で、性能にも影響します。速度はモデル、量子化形式、プロンプト長、推論ソフトの版でも変わるため、表は同じレビューの条件に限る参考値です。
ソフトウェアの選択
OpenVINOはIntelが提供する推論基盤です。2026年版のリリースノートはB70対応を明記しています。ほかにllama.cppのIntel GPU向けバックエンドや、vLLMのXPU向け構成もあります。使うモデルの配布形式が対応するかを先に確認すると、導入作業が進めやすくなります。GGUF形式ならllama.cpp系、OpenVINO形式ならOpenVINO系というように、モデルと実行環境を一組で考えます。
最初の検証には小さめのモデルを使い、GPUが選択されているか、実行中の専用VRAMと共有メモリの使用量を確認しましょう。初回起動時にはモデルの読み込み時間が入り、生成中のトークン速度とは別の待ち時間になります。GIGAZINEの23.4トークン/秒は生成段階の数値であり、モデルを切り替えるたびの読み込み待ちまでは含めて評価できません。常用を考えるなら、短い質問と長い文書の両方を同じソフトで試すと、コンテキスト長の影響が見えます。
32GBの実用上の価値
B70の長所は、24GBや16GBでは量子化率を高めたりCPU側へ逃がしたりするモデルを、より余裕を持って試せることです。文書検索、長いコードの読解、複数の会話を同時に処理する用途では、モデルの重み以外の領域が効きます。反対に小型モデルを一人で短文利用するだけなら、32GBの大半が空く場合もあります。用途に合わせて容量と速度を評価します。
単一GPUで扱えないモデルを検討する場合は、B70の複数枚構成で必要な分割方式を確認できます。メモリは2枚挿すだけで自動的に一つの64GB領域になるわけではなく、推論ソフト側の対応が要ります。
まとめ
Arc Pro B70は32GBを備え、OpenVINOが20~30B級の単一GPU推論を案内しています。Qwen3.8 27Bの実測では4bit版が23.4トークン/秒でしたが、GPU専用VRAMに加え共有メモリも使われました。動かしたいモデルの形式、推論ソフト、コンテキスト長を決めてから、必要容量を見積もるのが選び方の基本です。購入予算まで含めるなら国内価格の記事も合わせて確認してください。
