Microsoft、AIエージェントのデータベース状態評価ベンチマーク ThinkingBox を公開──507の業務ワークフローで検証
ツール呼び出しの成功ではなくデータベースの最終状態を検証する ThinkingBox により、単発の pass@1 と 20 回連続成功率の深刻な乖離を定量化した。
リリース: 2026-10-03 · 読了 4 分記事の要約
1. 核心(What)
- ThinkingBox は隔離された MCP ツールセッション上でエージェントを実行し、バックエンドのデータベース状態と副作用を評価するベンチマークである。
- 12の LLM モデルを対象に、507の業務タスクをそれぞれ 20 回繰り返して検証した。
- 失敗した試行のうち 77.61% で間違ったフィールド値が書き込まれ、43.30% で意図しない副作用が発生していた。
- Claude Opus 5.5 は単発成功率 67.16% で最高値を記録し、GPT-6 Sol は成功あたりのコストが $0.127 でコストフロンティアの最安値を記録した。
2. 影響(Why)
- 単発成功と連続成功の乖離: 1 回のテストで成功する能力と、20 回連続してミスなく状態を更新できる能力は完全に乖離しており、本番環境の信頼性担保には pass@20 の指標が不可欠となる。
- 国内エンタープライズの導入基準: [国内 金融・保険系システムインテグレーター] などの現場では、エージェントの誤ったデータベース書き込みが致命傷になるため、単発のベンチマークスコアではなく状態整合率に基づくモデル選定が必要になる。
3. 根拠・詳細(How)
- 検証アーキテクチャと実行環境: OpenEnv を通じてサンドボックス化された環境でタスクを実行し、エージェントが残したターミナルのバックエンド状態と副作用を直接コードで検証する設計を採用している。
- 試行回数とコスト効率の算出手法: 507タスクを各 20 回(計 10,140 回)実行し、OpenRouter の定価ベースでトークン消費量を計測、成功あたりのコスト効率(Cost per successful task attempt)を算出してパレートフロンティアを導出した。
4. 展望・課題(Next)
- オープンソースエコシステムへの展開: OpenEnv を通じたベンチマークの一般公開により、今後さらに多くのオープンウェイトモデルに対する状態整合性の評価が進む予定である。