AI Topica

解説

Android Bench 2.0とは何か 通過率91%→28%の理由を読み解く

AIにコードを書かせる企業が増える中、そのAIが「数日がかりの本格的な開発作業」にどこまで耐えられるかを示す物差しが変わりました。数値が大きく下がった背景を知らないと、ベンチマークの見出しだけで実力を誤解しかねません。

何が起きたか

Googleは2026年9月17日(米国時間)、大規模言語モデル(LLM)やAIエージェントのAndroid開発能力を評価するベンチマーク「Android Bench 2.0」を公開しました。エンジニアが数日から1週間ほどかけて取り組む複雑な長期タスク(Long-Horizon Tasks)を課す仕様に刷新されています。

従来のタスクにおける最高通過率は約91%でしたが、今回の長期タスク群における最高通過率は約28%へと急落しました。長期タスクで最も高い数値を記録したのはOpenAIの「GPT-6 Astra」で、通過率は28%にとどまっています。

Googleはベンチマークの基盤をLLM評価の枠組み「Harbor」フレームワークに適合させるとともに、モデル単体だけでなく開発環境と組み合わせたAIエージェントの評価も新たに導入しました。リーダーボードにはGoogleの「Gemini 3.8 Flash」、OpenAIの「GPT-6」、Anthropicの「Fable 5.1」など最新モデル群が並んでいます。

背景・解説

Android Bench 2.0は、AIにAndroidアプリの開発作業をやらせて、その仕上がりを採点する試験だと考えると分かりやすいです。従来のAndroid Benchや初期のAIコーディングベンチマークは、既存のプログラムに対する小さな修正やバグ直し、限定的な機能追加を評価する内容でした。これは当時のAI支援機能の実力に合わせた設計だったといえます。

Android Bench 2.0では、実際にAIへ委託される作業の重さに合わせて難易度が引き上げられました。導入された長期タスクには、ライブラリなど依存関係のアップグレード、新機能の追加、ゼロからのアプリ構築、他OS向けアプリのAndroidへの移植が含まれ、いずれもエンジニアが数日から1週間ほどかけて取り組む規模です。

評価方法も変わりました。従来は「合格か不合格か」の二択評価でしたが、数日がかりの作業ではこれでは実態を反映できません。例えば40画面を「Jetpack Compose」というUIツールキットに書き換え、要求の90%を満たしたAIエージェントがいたとしても、1カ所の検証に失敗しただけで0点にされてしまうと、そのAIが持つ設計力を見落とすことになります。そこでGoogleは、機能性やUIの再現度、既存部分を壊していないかを組み合わせて「完了率」を算出する連続スコアリング方式を採用しました。

テスト結果からは得意・不得意も見えてきました。AIは新規コードの作成では高い性能を示す一方、既存コードの書き換え(リファクタリング)では苦戦する傾向があります。Javaから別言語への変換のような手順が確立した定型作業には強く、125以上のファイル・8000行超のコードベースでも一貫した処理ができていました。ただし実行時の検証が必要な作業や、未公開のライブラリなど「知識の空白」に直面する作業では性能が大きく落ち込み、他OSアプリのAndroid移植では完了率が最大でも80%にとどまり、100%を達成したモデルはありませんでした。

仕事や業務への影響 — AI Topicaの見方

自社の開発チームがAIコーディングツールを選ぶ際は、「通過率91%」といった数字だけを見て導入判断をすべきではありません。今回のベンチマークが示す通り、簡単な修正作業と数日がかりの本格開発では、同じAIでも成績が91%から28%まで変わってしまうためです。

例えば、社内に5人のAndroidエンジニアを抱える中堅ITベンダーが「新機能をゼロから1つ追加する作業」をAIに任せるなら、期待値は高く持って構いません。データによれば新規コード作成はAIが最も得意とする領域であり、定型的な変換作業なら8000行規模のコードベースでも一貫した処理ができています。

一方、同じ会社が「既存アプリのリファクタリング」や「他OSアプリのAndroid移植」をAIに任せる場合は話が別です。移植作業では最先端モデルでも完了率は最大80%止まりで、100%を達成した例は1つもありません。この種の作業は、AIの出力をそのまま採用せず、エンジニアによる最終確認の工程を残すべきです。人手を完全に置き換えるのではなく、AIに下書きを作らせて人が仕上げる体制が、当面は現実的な運用になります。

不確かな点・注意

今回の評価は、モデル提供元がそれぞれ用意したエージェントツールとの組み合わせで実施された段階のものです。OpenAIのモデルは「Codex」、GoogleのモデルはGoogle Antigravityという実行環境で動かされており、実行環境の設計自体がトークン消費量や効率に影響することが分かっています。つまり同じモデルでも組み合わせるツールが変われば数値が変わる余地があります。

また、Googleは今後さまざまなモデルとエージェントツールの組み合わせで評価結果を拡充する方針を示しているだけで、現時点のリーダーボードが最終的な序列とは限りません。長期タスク・マルチモーダル評価・エージェント環境・連続スコアリングを組み合わせた評価体系は発展途上にあり、通過率28%という数字も今後の検証で変動する余地が残っています。

出典

  1. 「1週間の開発タスク」でAIの限界を検証 Googleが「Android Bench 2.0」公開

AI Topica 編集部