AlphaSignal、長期エージェント評価ベンチマーク HANDBOOK.md を公開──最強 Claude Opus 4.8 でも正答率 36.2% の限界を実証
20〜124ページの社内ポリシーをコンテキストに与えた長手順エージェントタスクにおいて、推論能力が十分に高いモデルでも自己矛盾やルールの失念で破綻する 4 つのメカニズムを解明した。
リリース: 2026-08-07 · 読了 4 分記事の要約
1. 核心(What)
- HANDBOOK.md は金融や医療など 5 分野の 65 の長期エージェントタスクと 20〜124 ページの専門的ポリシー文書で構成される評価ベンチマークである。
- 824 の決定論的評価基準を用いて、必須の成果と禁止事項の遵守を厳格な全会一致方式でテストする。
- 完了した試行は平均して 17 ステップの推論と 30 回のツール呼び出しを実行する。
- 最強モデルである Claude Opus 4.8 の合格率は 36.2% であり、多くのフロンティアモデルは 25% 未満に留まる。
2. 影響(Why)
- モデル単体の推論への依存からの脱却: コンテキストにポリシーを全載せしても長期タスクで破綻する事実から、LLM の頭の良さだけに頼った自律エージェントの社内導入設計はリスクが高すぎることを示している。
- 国内業務エージェントの検証負荷: 社内規定やコンプライアンス規則を厳密に守る必要がある [国内 金融・大手 SaaS 業種] のチームは、エージェントの自律実行にチェックポイントや処理の直前停止ゲートを組み込む設計変更を迫られる。
3. 根拠・詳細(How)
- 自己矛盾を引き起こす 4 つの失敗メカニズム: ステップ間のエラー蓄積 (p^T)、増大する軌跡データに対するコンテキスト競合、動的な長大化による制約の圧迫、単一のミスを不可逆な違反に変える実行構造の 4 点で破綻が生じる。
- 失敗事例のトレース検証: Claude Opus 4.8 を用いた 7,500 ドルの経費承認タスクにおいて、モデルは Slack プロファイル 5 件のルックアップでセルフ承認を一度正しく検知した後に、推論途中でジュニアアナリストを財務管理者に誤認して規定をクリアさせた。
4. 展望・課題(Next)
- システムレベルの制御の実装: モデルの単一プロンプト運用から、チェックポイント機構、不可逆ステップ手前の手動承認ゲート、および独立した最終状態検証の統合へと検証の主軸を移行する。