📜Papers🔥🔥

AI エージェントの実行時間制御と時間認識を評価する新ベンチマーク AgentTime──実測値との乖離係数 1.2 から 2.9 までを実証

AI エージェントのランタイム制御や時間予測能力を検証するベンチマーク AgentTime を提案し、最先端モデルにおける時間制御精度の実態と課題を明らかにしました。
リリース: 2026-10-07 · 読了 5 分

論文概要

AI エージェントの自律実行において、自身のランタイム(実行時間)を管理・予測する「時間認識(Time-awareness)」の重要性が高まっている。本論文では、エージェントが指定された時間通りに稼働できるか、自身のランタイムを予測できるか、経過時間を事後推定できるかをテストする新しいベンチマーク「AgentTime」を提案している。AgentTime は、コーディングやコンピュータ操作、自動研究など 18 のソースから収集された 222 のタスクで構成されている。実験の結果、Claude Code(Fable 5.1)の実行時間の乖離係数が 2.9imes imes であるのに対し、Codex 内の GPT-6 Astra では 1.2imes imes に留まるなど、モデル間で時間制御能力に大きな差があることが示された。

関連研究

従来の研究ではエージェントの時間認識に関する側面が部分的に探求されてきたが、ネイティブなエージェントハーネスにおけるデュレーション・フォローイング(duration-following)や実行時間コントロールに関する体系的な評価は未開拓であった。本研究は、指定時間通りの動作、事前予測、事後推定の 3 つの軸を統合的に検証する初めての試みである。

新規性と貢献

本研究の主要な貢献は、約 1 分から数日間に及ぶ多様な時間指定タスクを含むベンチマーク「AgentTime」の構築にある。単にタスクを完了できるかだけでなく、「要求された時間を使い切って作業し続けられるか」「自身の速度を正しく見積もれるか」という長期運用に不可欠な制御性能を定量的に評価した点が新しい。

提案手法の詳細

AgentTime は、エージェントに対して動作時間を指定する単一の指示を付加するプロトコルを採用している。Figure 1: Astra keeps time while Fable does not, showing runtime comparisons across different models. 上記の図版が示すように、モデルごとのランタイムの比較において時間維持の挙動に明確な差異が存在する。なぜこのような設計にしたかといえば、長期間の自律運用において、エージェントが途中で処理を早期終了させたり、逆に無限ループに陥ったりすることを防ぐための厳格な評価基準が必要だからである。

評価・考察

評価実験では、指定された時間に対する実際の稼働時間の乖離が測定された。Figure 2: Forecasts made in each agent's native harness compared with separate runs without requested duration.Figure 3: Retrospective estimates from Fable 5.1, GPT-5.6 Sol, and GPT-6 Astra regarding how long their finished runs took. 予測実験において、エージェントの予測は自然な実行時間を過大評価する傾向が確認された。また、事後推定実験では、時間的情報を削除すると Sol や Astra の推定誤差が 2 倍以上に膨らみ、Fable でもほぼ 2 倍に達することが示された。さらに、指定時間を満たしているように見えるケースでも、実際には完了後に明示的に待機(スリープ)している挙動がトランスクリプトの分析から確認されており、時間制御とタスク遂行の乖離が浮き彫りになった。

応用例と今後の展望

本研究の成果は、ソフトウェア開発や金融データ分析などの分野における自律型 AI エージェントの信頼性向上に応用できる。日本のエンジニアやテックリードが実務において、数時間から数日にわたる長期的タスクをエージェントに安全に委譲する際、単なるタスク正解率だけでなく時間制御の健全性を監視・評価する仕組みの導入が必須となる。今後の課題としては、制御メカニズム自体の改良や、より高度な自己監視機構の確立が挙げられる。

結論

エージェントがタスクを完了できる能力は、自身の時間を制御したり要求された時間全体を通じて稼働したりできることを保証しない。安全で自律的な長期運用を実現するためには、タスク遂行能力と時間制御能力の両方を評価する必要がある。

注釈

  • ランタイム: プログラムやエージェントが実行されている時間。
  • ハーネス: エージェントの実行環境や枠組みを指す言葉。