🧠Research🔥🔥

Microsoft、AIエージェントのデータベース状態評価ベンチマーク ThinkingBox を公開──507の業務ワークフローで検証

ツール呼び出しの成功ではなくデータベースの最終状態を検証する ThinkingBox により、単発の pass@1 と 20 回連続成功率の深刻な乖離を定量化した。
リリース: 2026-10-03 · 読了 4 分

記事の要約

1. 核心(What)

  • ThinkingBox は隔離された MCP ツールセッション上でエージェントを実行し、バックエンドのデータベース状態と副作用を評価するベンチマークである。
  • 12の LLM モデルを対象に、507の業務タスクをそれぞれ 20 回繰り返して検証した。
  • 失敗した試行のうち 77.61% で間違ったフィールド値が書き込まれ、43.30% で意図しない副作用が発生していた。
  • Claude Opus 5.5 は単発成功率 67.16% で最高値を記録し、GPT-6 Sol は成功あたりのコストが $0.127 でコストフロンティアの最安値を記録した。

2. 影響(Why)

  • 単発成功と連続成功の乖離: 1 回のテストで成功する能力と、20 回連続してミスなく状態を更新できる能力は完全に乖離しており、本番環境の信頼性担保には pass@20 の指標が不可欠となる。
  • 国内エンタープライズの導入基準: [国内 金融・保険系システムインテグレーター] などの現場では、エージェントの誤ったデータベース書き込みが致命傷になるため、単発のベンチマークスコアではなく状態整合率に基づくモデル選定が必要になる。

3. 根拠・詳細(How)

  • 検証アーキテクチャと実行環境: OpenEnv を通じてサンドボックス化された環境でタスクを実行し、エージェントが残したターミナルのバックエンド状態と副作用を直接コードで検証する設計を採用している。
  • 試行回数とコスト効率の算出手法: 507タスクを各 20 回(計 10,140 回)実行し、OpenRouter の定価ベースでトークン消費量を計測、成功あたりのコスト効率(Cost per successful task attempt)を算出してパレートフロンティアを導出した。

4. 展望・課題(Next)

  • オープンソースエコシステムへの展開: OpenEnv を通じたベンチマークの一般公開により、今後さらに多くのオープンウェイトモデルに対する状態整合性の評価が進む予定である。