Intel Arc Pro B50には16GBのGDDR6メモリーがあります。ローカルLLM用に買うなら、モデルをGPU内に置けるかと、文章をどの速度で生成できるかが気になるでしょう。B50は7B~14B級の量子化モデルを試す容量を持ち、独立テストでも応答速度のデータが出ています。まずメモリー容量と計算速度を分けて見ます。
16GBに収めるモデルの目安
Intelの公式データシートは、B50に16GB GDDR6、224GB/sのメモリー帯域幅、128基のXMXエンジンを記載しています。量子化した7Bモデルは重みだけなら数GB、14Bモデルはおおむねその倍の領域を使います。推論時には重みのほかにKVキャッシュ、コンテキスト、実行ソフトの作業領域が必要です。16GBすべてをモデル重みに割り当てる計算にはできません。
モデルサイズが近くても、Q4やQ8など量子化形式が違えば必要容量が変わります。長い文章を一度に渡す場合はKVキャッシュも増えるため、短いチャットで動いたモデルが長文の処理でメモリー上限に達することがあります。16GBでは7B~14B級を基本にし、モデルの実ファイル容量と希望するコンテキスト長を組み合わせるのが現実的です。さらに大きいモデルではCPU側メモリーへの退避が増え、応答は遅くなります。
重みの大きさは「パラメーター数×量子化後のビット数」から概算できます。14Bを単純に4bitへ落とした理論上の重みだけなら約7GBですが、実際のモデルファイルには量子化の補助データも入り、推論時はKVキャッシュと実行領域も使います。モデルを選ぶ際は公開されているファイルサイズに加え、使うコンテキスト長で増える分を16GBの内側に残します。快適さは、メモリーに収まった後の生成速度も含めて判断できます。
Intel GPUでの実行経路
B50でローカルLLMを動かす方法には、Intel GPUに対応するOpenVINOと、llama.cppのSYCLバックエンドがあります。llama.cppの公式SYCL文書はIntel Arc系GPUを対象に含めています。IntelもデータシートでoneAPI、OpenVINO対応を記載しています。Windows 11とLinux UbuntuがIntel資料にあるOSの範囲です。
アプリの名前だけでGPU利用を確信するより、実行バックエンドを選ぶ方が確実です。たとえばllama.cppでSYCL版を使えばIntel GPU向けの処理経路になります。CUDAのみを対象にした拡張機能は同じ手順では動かないため、使用予定のUIや推論サーバーがSYCLまたはOpenVINOを扱う構成かを先に決めます。IntelのXMXエンジンは対応する演算に使われ、170TOPSはINT8の理論最大値です。
llama.cppのSYCL文書は、Intel GPU向けビルドの準備から実行までを独立した手順として掲載しています。手元のアプリがllama.cppを使っていても、配布バイナリーが別のGPUバックエンドだけで作られていれば、B50の演算器は使われません。B50をLLM用に評価するなら、採用するフロントエンドがどの実行バイナリーを呼び出すかまで決めると、16GBをGPU側で生かす構成になります。
実測で見る応答速度
Puget SystemsのMLPerf Client 1.0テストでは、複数モデルの幾何平均で初回トークンまでの時間がB50は0.2秒、RTX A1000は1.0秒と示されています。同じグラフの生成速度はB50が毎秒54トークン、A1000が28トークンです。比較はテストに使ったモデルと実装を含む結果で、手元の任意のLLMが毎秒54トークンになるという意味ではありません。
別のStorageReviewのProcyonテストでは、Phi系モデルのB50は初回応答0.275秒、生成72.128トークン/秒、Mistral系では0.346秒、46.799トークン/秒でした。モデルが変わるだけで生成速度が大きく動くことが分かります。同レビューのLlama 2欄にはB50の測定値が掲載されておらず、この試験からはLlama 2の速度を判断できません。
PugetのMLPerf ClientとStorageReviewのProcyonは、モデル、測定方法、推論ソフトが異なる別の試験です。Pugetの結果は同じ試験内でA1000との比較に使い、StorageReviewの結果はPhi系とMistral系の速度幅を知る資料になります。最初の応答までの待ち時間と連続生成速度を分けて見ると、チャット用途の体感に近づきます。
16GBと70Wの組み合わせ
B50はカード電力70Wで補助電源端子が要りません。常時起動する小型の推論PCや、普段は事務作業を行うワークステーションへ足す構成に向きます。長文生成を大量に並列実行する場合には、16GBの容量に加え224GB/sの帯域幅と16基のXeコアが上限になります。ひとり用の短い対話と、複数ユーザーへ同時に応答するサーバーでは重視する性能が変わります。
まとめ
Arc Pro B50は、16GBに収まる量子化LLMを低電力のPCで試す選択肢です。7B~14B級を起点にモデルサイズ、量子化形式、コンテキスト長を決め、SYCLまたはOpenVINOに対応した実行環境を組みます。購入前には、この記事とクラスタの価格記事を合わせて見て、必要な生成速度に対する支出を判断してください。
