Google、AI エージェント評価ベンチマーク Android Bench 2.0 を公開──長期タスクで最高正解率が 28% に低下
開発者が 1 週間かけて取り組む複雑な長期タスクを導入し、現行 LLM エージェントのアーキテクチャ上の限界と設計課題を明らかにしている。
リリース: 2026-09-26 · 読了 3 分記事の要約
1. 核心(What)
- Googleは2026年9月17日、AIエージェントのコーディング能力を測定する最新ベンチマーク「Android Bench 2.0」を公開した。
- 開発者が1週間程度かけて取り組む複雑な長期タスク(Long-Horizon Tasks: LHT)を評価対象に導入し、難易度を大幅に引き上げた。
- 従来の類似ベンチマークで最高91%だった正解率が、Android Bench 2.0の長期タスクでは最高28%へと急低下した。
- 評価にはオープンソースのAIエージェント評価フレームワーク「Harbor」が採用され、モデル単体ではなく開発ツールとの組み合わせで評価が行われる。
2. 影響(Why)
- 実務的な長文脈タスクの限界: 1週間規模のリファクタリングではコードの量だけでなくアーキテクチャの整合性を維持する必要があり、現行 LLM の設計ではコンテキスト管理やエラー伝播の面で破綻が生じやすい。
- 国内受託開発への影響: [国内 モバイルアプリ受託開発企業] のような現場では、AIエージェントに大規模なアーキテクチャ移行をそのまま委譲すると致命的な設計ミスを招くため、当面は人間のエンジニアが主導する二段構えの運用が求められる。
3. 根拠・詳細(How)
- 複雑な依存関係と長期タスクの設計: JavaからKotlinへのコード移行、RetrofitからKtorへの置き換え、ViewModel層の統合など、125以上のファイルと8000行規模のコードベースで実用的なデザインパターン適用能力を検証する。
- アプローチと結果の内訳: モデル単体の性能に加え、プロンプトキャッシュやエージェントツールの組み合わせにより、最高正解率28%を記録したOpenAIのGPT-6 Astraをはじめ各社モデルの限界と依存関係グラフの処理能力が数値化された。
4. 展望・課題(Next)
- マルチモデルとエージェントの組み合わせ検証: Googleは今後、多様なモデルとエージェントツール、アセスメントログを組み合わせた最適なAIツール選定の枠組みを整備する予定である。