AI Topica

比較・活用

ローカルLLM用GPU比較 Intel「Arc Pro B70」32GBとNVIDIA機、得意分野はどこで分かれるか

ローカルLLMを自社サーバーで動かしたいが、GPU予算をどこまでかけるべきか迷う担当者は少なくありません。VRAM容量を重視するか、演算性能を重視するかで、選ぶべきGPUは変わります。

何が起きたか

GIGAZINEは、VRAM容量32GBを搭載し価格が30万円未満のIntel製グラフィックボード「Intel Arc Pro B70 Creator 32GB」を使い、ローカルLLM「Qwen3.8 27B」と動画生成AI「MiniMax H3」の実行速度を確かめました。

LLM実行アプリ「Unsloth Desktop」でQwen3.8 27Bの4bit量子化版を動かした結果、VRAM使用量は30.0GBで、デコード速度は23.4tok/sでした。8bit量子化版ではVRAM使用量30.2GB、デコード速度15.9tok/sという結果になっています。比較として、以前NVIDIA GeForce RTX 5070 Tiで同じQwen3.8 27Bを実行した際は、2bit量子化版でようやく20〜30tok/sという状況だったとしています。

画像生成AI「Z-Image-Turbo」では、1024×1024ピクセル・ステップ数8の条件で1枚目が36.23秒、2枚目以降は5.3秒前後で生成完了しました。一方、動画生成AI「MiniMax H3」を5秒・8ステップで実行したところ、1本目302.06秒、2本目351.14秒かかり、VRAM容量16GBのGeForce RTX 5070 Tiよりも遅い結果になったとしています。ゲームベンチマーク「ファイナルファンタジーXIV: 黄金のレガシー」も実施し、1920×1080最高品質で1万8434点、3840×2160最高品質で9342点を記録しました。

背景・解説

ローカルLLMとは、クラウド上のAPIを使わず、自社の端末やサーバー上で大規模言語モデルを動かす仕組みを指します。VRAMはグラフィックボードに搭載されたメモリで、モデルのパラメーターや計算途中のデータを載せる容量です。VRAMが不足すると、モデルを圧縮する「量子化」の度合いを強めるか、モデル自体を小さくする必要が出てきます。量子化には4bitや8bitといった段階があり、bit数が大きいほど元のモデルに近い出力品質を保てますが、必要なVRAM容量も増えます。tok/s(トークン毎秒)は生成速度の単位で、数値が大きいほど文章の出力が速いことを示します。

今回の記事によれば、Intel Arc Pro B70 Creator 32GBは大容量のVRAMを武器に、比較対象として挙げられたNVIDIA GeForce RTX 5070 Ti(VRAM16GB)よりも高い量子化精度でQwen3.8 27Bを動かせています。一方で、コンテンツ生成AIの推論システムはNVIDIA製GPUに最適化されていることが多く、演算性能が同水準のGPU同士でもNVIDIA製GPUに有利に働きやすいと記事は指摘しています。動画生成AI「MiniMax H3」の生成速度がVRAM容量の少ないGeForce RTX 5070 Tiに劣ったのは、この点が影響しているためだとしています。

仕事や業務への影響 — AI Topicaの見方

社内でローカルLLMの導入を検討する担当者は、まず「文章生成中心か、動画生成も含むか」で機種を分けて考えるべきです。例えば、社員50人規模の企業で情シス担当が1人、AIエージェントに社内メールの分析や文書要約をさせたいだけなら、Intel Arc Pro B70 Creator 32GBのようなVRAM容量重視のGPUで十分です。8bit量子化版でも15.9tok/sという速度が出れば、リアルタイムの会話用途でなくバッチ処理で回すエージェントには問題になりません。

一方、マーケティング部門で動画広告の生成AIを日常的に回す予定がある会社は話が別です。今回の記事では、VRAM容量が2倍あるIntel製GPUでも、動画生成AI「MiniMax H3」の生成時間はVRAM16GBのNVIDIA製GPUより長くなりました。1本あたり300秒台の差が積み重なれば、月間の生成本数が多い部署ほど作業時間のロスは無視できなくなります。動画生成が主目的の部署には、価格が高くてもNVIDIA製GPUを割り当てる判断が妥当です。

予算配分を1台にまとめられない場合は、用途別に2種類のGPUを使い分ける運用も選択肢になります。文章系のエージェント用サーバーにはVRAM容量重視のGPUを、動画生成用のワークステーションには演算性能重視のGPUを割り当てれば、限られた予算でも部署ごとの体感速度を落とさずに済みます。

不確かな点・注意

今回の結果は、特定のCPU(AMD Ryzen 5 7600X)やマザーボード、ドライバーバージョン「32.0.101.8991」、Unsloth Desktopのバージョン「0.1.808-beta」など、一連の構成のもとで得られた数値です。異なるCPUやメモリ構成、別バージョンのソフトウェアを使った場合、同じ速度が出るとは限りません。

また、比較対象として挙げられたNVIDIA GeForce RTX 5070 Tiでの数値は、今回とは別の機会にHermes AgentというAI実行アプリで測定されたものです。実行アプリやモデルの読み込み方法が異なるため、厳密な同一条件での比較ではない点には注意が必要です。動画生成AIについても、MiniMax H3という1つのモデルでの結果であり、他の動画生成AIや設定が異なる場合の優劣までは分かりません。Intel Arc Pro B70 Creator 32GBを使ったAIエージェント実行のレビューは、後日別記事で公開予定とされており、業務での実用性についてはその内容も踏まえて判断するのが望ましいといえます。

出典

  1. VRAM容量32GBで30万円未満なIntelグラボ「Intel Arc Pro B70 Creator 32GB」でローカルLLM「Qwen3.8 27B」や動画生成AI「MiniMax H3」を実行して生成速度を確かめてみた

AI Topica 編集部