AI Topica

解説

AIが「考えすぎてコスト増」を防ぐ仕組み Ember-1の思考圧縮とは

AIエージェントの利用料が想定より膨らんでいる企業は、モデルの「思考の長さ」を疑ってみるべきです。高性能モデルほど内部で長い推論を出力し、それがそのまま利用料に跳ね返る構造があるからです。Fireworks AIが発表した新モデルは、この構造そのものに手を入れています。

何が起きたか

AIの追加学習サービスを展開するFireworks AIが、AIモデル「Ember-1」を発表しました。ベースになっているのは大規模言語モデル「Kimi K3」です。Fireworks AIによると、Ember-1はKimi K3と比べて出力トークン数を約35%削減しながら、性能はほぼ維持できているといいます。

医療分野のタスクを測るベンチマーク「Bedside Bench」で比較したところ、Ember-1はKimi K3と同程度のスコアを、より低いコストと短い処理時間で達成しました。従業員を対象にKimi K3からEmber-1へ置き換えるテストを行った結果、問題の報告は1件もなかったといいます。さらに顧客2社を対象にしたA/Bテストでも、性能を保ったまま出力トークンを約35%削減できることが確認されました。

Ember-1のAPI料金は、100万トークンあたり入力3ドル(約470円)、キャッシュ済み入力0.3ドル(約47円)、出力15ドル(約2350円)に設定されています。

背景・解説

ここでいう「思考」とは、AIモデルが最終的な回答を出す前に内部で生成する、推論過程の出力を指します。近年の高性能モデルは、この思考過程を長く出力するほど正答率が上がる傾向があり、各社は思考量を増やす方向で性能を競ってきました。

ところがFireworks AIによると、Kimi K3のような高性能モデルでは、出力トークンの90%程度が思考部分に費やされているといいます。AIエージェントとして使う場合、タスクの1ターンごとにそれまでの文脈をすべて読み込み直す仕組みになっているため、思考が長いモデルほどコストが雪だるま式に膨らんでしまいます。

Fireworks AIはこの課題に対し、Kimi K3に追加学習を施すという方法で対応しました。思考内容のうち「問題を解くために有用なフィードバック」などの部分は残しつつ、結論に寄与しない冗長な部分を削るよう学習させることで、Ember-1を構築したとのことです。その結果、比較対象だったGPT-5.6 Solとの位置関係も変わりました。Kimi K3は「性能は低いのに高コスト」という評価だったのに対し、Ember-1は「性能は同水準でも低コスト」という位置づけに変わりました。

仕事や業務への影響 — AI Topicaの見方

思考モデルを業務で使っている企業ほど、トークン単価だけでなく「思考の長さ」を見直す価値があります。例えば、社内問い合わせ対応にAIエージェントを導入し、月間1万件のやり取りをKimi K3系のモデルで処理している情報システム部門があるとします。出力トークンが35%減るだけで、月々のAPI費用は単純計算でも数割規模で下がります。

とくにエージェントが何十ターンも会話や作業を繰り返す用途では、思考の長さがそのまま累積コストに直結するため、モデルを切り替える効果は一度きりの利用より大きく出ます。一方で、思考量を削ったモデルが自社のタスクでも同じ精度を保てるかどうかは、ベンチマークの数字だけでは判断できません。

まずは自社の代表的なタスクを使い、既存モデルと出力トークン数・回答品質の両方を並べて比べてから切り替えるべきです。コストだけを見て全面移行するのは避け、限定的な業務から段階的に試すので十分です。

不確かな点・注意

Ember-1の性能評価は医療分野のベンチマーク「Bedside Bench」が中心で、法務や営業など他分野での精度は出典からは分かりません。従業員テストや顧客2社のA/Bテストについても、具体的な人数や期間、業種は明らかにされていないままです。

日本語での性能や日本国内での提供状況についても、出典には記載がありません。API料金は米ドル建てで示されており、記事中の円換算額はあくまで目安です。

出典

  1. 最先端AIモデルの「思考しすぎてコスト増加」を解決するべくKimi K3ベースで開発されたAIモデル「Ember-1」が登場

AI Topica 編集部