比較・活用
ローカルAIエージェント、Magnitudeとllama.cppの使い分け方
社内PCでAIエージェントを動かす情シス担当者にとって、推論エンジン選びは速度と待ち時間を左右する実務上の判断です。新顔の「Magnitude」は既存の「llama.cpp」と何が違うのか、置き換えるべき場面はどこかを整理します。
何が起きたか
AIエージェントをローカル実行する際に使うハードウェアへ自動最適化する推論エンジン「Magnitude」が公開されました。開発チームによると、特定条件下でオープンソースの推論エンジン「llama.cpp」と比べて最大で約2倍の速度を記録しています。
4bit量子化した「Qwen 3.6 35B A3B」を64Kトークンのコンテキスト長で動かした比較では、Appleシリコン搭載のM4 Pro機でMetal使用時の生成速度が毎秒30トークンから毎秒57トークンへ、NVIDIA DGX SparkのCUDA環境では毎秒49トークンから毎秒58トークンへ向上したといいます。
macOS・Windows・Linuxに対応し、Appleシリコン・NVIDIA製GPU・AMD製GPU・CPUのみの環境でも動作します。Pi、OpenCode、Hermes、Codexなど複数のAIエージェント用ツールと接続でき、OpenAI互換APIも用意されています。ソースコードはApache License 2.0で公開中です。
背景・解説
推論エンジンとは、AIモデルの計算を実際のハードウェア上で実行するためのソフトウェアです。これまで広く使われてきた「llama.cpp」は、幅広い機種に対応することを優先して設計されてきました。
一方でAIエージェントは、ファイルの読み書きやコマンド実行を繰り返しながら会話を続けるため、1回のやり取りが長くなりやすく、複数のエージェントを同時に動かす場面も増えています。Magnitude開発チームは、データセンター向けの推論エンジンが大量のリクエストをまとめて処理する用途に向けて最適化されているのに対し、ローカルPCでエージェントを長時間動かす用途には別の工夫が要ると考えました。
そこでMagnitudeは、実際に使うPC上で計算処理の最小単位である「カーネル」をコンパイルし、搭載ハードウェアごとにパラメーターを調整する方式を採用しています。さらに、複数セッションで共通するプロンプト部分の計算結果を使い回す「プレフィックスキャッシュ」や、必要な分だけメモリを確保して解放する仕組みも備えています。
仕事や業務への影響 — AI Topicaの見方
社内で複数のAIエージェントを同時に動かす情シス担当者ほど、Magnitudeへの乗り換えで得られる効果は大きくなります。
例えば、従業員80人程度のSaaS企業で、情シス担当者が1人で社内向けコーディングエージェントを3台のノートPCに展開している場合を考えてみます。llama.cppで毎秒30トークンの生成速度だと、長い出力を待つ時間が積み上がり、1人あたりの待ち時間は1日で数十分単位になります。Magnitudeに切り替えて毎秒57トークンまで速度が上がれば、同じ作業量でも待ち時間はおよそ半分に縮みます。
メモリ使用量もMetal環境で約28%、CUDA環境で約27%減ると公表されているため、同じPCで別の作業を並行させやすくなる点も実務上の利点です。既にllama.cppで運用を固めている会社は、無理に乗り換える必要はありません。接続先のツールがPi、OpenCode、Hermes、Codexなど限られた顔ぶれにとどまる点も考えると、まずは検証用の1台だけMagnitudeを試し、速度やメモリ消費の差を比べてから展開台数を決めるべきです。
NVIDIA・AMD製GPUやCPUのみの環境でも動く設計なので、社内のPC構成がばらついている会社でも導入の壁は低くなっています。
不確かな点・注意
Magnitudeの比較データは開発チーム自身による計測であり、独立した第三者による検証結果は明らかになっていません。速度向上の幅はモデルの種類や量子化方法、コンテキスト長によって変わりやすく、すべての用途で同じ倍率が出るとは限らない点に注意が必要です。
対応するAIエージェント用ツールも現時点ではPi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineなどに限られており、社内で使っている別のツールとの接続可否は確認が必要です。GPUメモリに収まらない大規模モデル向けの「Expert streaming」など計画中の機能は、公開時点ではまだ実装されていない段階です。