AI Topica

解説

トークン単価8割安なのにAI請求額が増える理由

トークン単価が下がっているはずなのに、なぜ月末のAI利用料は増えるのでしょうか。背景には、AIエージェントが一つのタスクをこなすために裏側で何十回もAPIを呼び出し、同じ文脈を何度も読み直す「見えない浪費」の仕組みがあります。経理や情シスの担当者がコストの内訳を知っておく意味は小さくありません。

何が起きたか

大規模言語モデル(LLM)のトークン単価は、2025年から2026年にかけておおよそ8割下がりました。競争と効率化によって、同じ処理にかかる費用は下がり続けている状況です。

ところが、企業が支払うAIの請求額は増えています。LLM APIへの支出は2025年に84億ドルを超え、なお倍増のペースにあると報告されています。同じ性能を得るためのトークン単価は年におよそ10分の1のペースで下がり続けているとの分析もあり、GPT-3級の性能を得るコストは2021年の100万トークン当たり約60ドルから、2024年後半には約0.06ドルまで下落しました。3年で1000分の1近い下落幅です。

単価が大きく下がっているにもかかわらず、支出全体は膨らんでいます。数十人規模で試験導入したつもりが、月末の請求書が想定の3倍になっていた、という状況も珍しくないといいます。

背景・解説

鍵になるのは、支払いの単位が「トークン」ではなく、実質的に「タスク」だという点です。一問一答のチャットであれば消費は一度きりで小さく収まりますが、AIエージェントは計画を立て、ツールを呼び、結果を読み、また計画を練り直すというループを回します。1つのタスクを片づけるのに、モデルを数十回から200回近く呼び出すことも珍しくありません。

Anthropicの研究によれば、エージェント型のワークフローは通常のチャットのおよそ4倍、複数のエージェントが連携する構成では15倍ほどのトークンを消費します。長時間動くエージェントでは、1つのタスクで数千万トークンに達する例も報告されています。会話履歴を毎ターン送り直す設計も見えにくい増加要因で、20ターンのやりとりで当初数百トークンだったセッションが1万トークンを超えることもあります。費用は回数に比例するのではなく、二次関数的に膨らんでいく計算です。

さらに、本番運用のAIコストの約72%は、モデル利用料そのものではなく、オーケストレーションやリトライ、検索、可観測性といった周辺処理で発生しているとされます。請求書に載るトークン代は全体の一部にすぎません。

こうした状況を受け、コストを独立した管理対象として扱う組織の割合は、FinOps Foundationの調査で2024年の31%から2025年に63%へ倍増し、2026年には98%に達しました。AIコストは一部の技術者だけの関心事ではなく、経理が向き合う費目になっています。

加えて、MCPサーバの設計も浪費の一因です。既存のREST APIを機械的にツール化すると、ツール定義そのものが大量のトークンを消費します。GitHubの公式MCPサーバはツール定義を並べるだけで約4万2000トークンを使い、複数のサーバをつなげば6万トークンを超え、フロンティアモデルのコンテキスト枠の3〜5割を占めてしまいます。ツールが多過ぎると、名前の似たツールを取り違えるなど精度も落ちるという検証結果があります。逆に、使うツールを必要なものだけ取り出す方式にしたところ、ツール選択の精度が3倍以上に上がり、プロンプトのトークンは半分以下になったという研究結果も示されています。

仕事や業務への影響 — AI Topicaの見方

AI利用料の請求書を見て単価の安さだけに安心している会社は、来月も同じ驚きを味わうことになります。例えば、従業員50人規模の会社でカスタマーサポート用のAIエージェントを試験導入した場合、担当者3人が想定した月数万円の利用料が、ツール呼び出しの多段化や会話履歴の再送によって、気づかぬうちに10万円を超える請求になることがあります。原因は単価ではなく、誰が何にどれだけ使っているかを把握できていないガバナンスの不在です。

情シス部門は、AIエージェントに渡すツールの数を機能の網羅ではなくタスクの設計として見直すべきです。200近いAPIエンドポイントをそのままツール化するのではなく、「顧客を照会する」「注文を確定する」といった意図の単位で10〜30程度に絞り込むやり方が有効です。経理部門は、AI利用料を他の経費と切り分けて独立の費目として管理し、部署ごと・用途ごとの消費量を月次で確認する体制を作る段階に来ています。

結論として、トークン単価の下落をコスト削減の根拠にするのは早計です。エージェントの呼び出し回数とツール設計を点検しない限り、請求額は単価とは逆方向に膨らみ続けます。

不確かな点・注意

記事中の数値は、研究者や企業による分析・検証の結果として報告されているものであり、全ての企業・用途に同じ比率で当てはまるとは限りません。消費量の増加幅やコスト内訳の割合は、利用するモデルやMCPサーバの構成、業務内容によって変わります。

また、ツール定義の絞り込みやAPI設計の見直しがどの程度の費用削減につながるかは、出典内でも事例ベースの数値にとどまり、業界横断の平均値としては示されていません。自社でAIエージェントを導入する際は、まず請求明細を部署・用途別に分解し、トークン消費の多い箇所を特定する作業から始める必要があります。

出典内で紹介されている具体的な削減策(5つのポイント)は続編記事で扱われる予定であり、今回時点では詳細が明らかになっていません。

出典

  1. 「トークン単価は8割下がった。なのに請求額は増えた」――その“見えないAI浪費”の正体

AI Topica 編集部