📜Papers🔥🔥

LLMエージェントの長ホライズン劣化に関する実証研究──16ステップ以内で成功率がほぼゼロに収束する幾何学的崩壊を実証

9モデルと3つの独自システムを用いた大規模検証により、タスク成功率はステップ数に応じた幾何学的減衰に従い、コンテキスト制限よりもステップ数が崩壊の主因であることを解明した。
リリース: 2026-08-31 · 読了 5

論文概要

LLMエージェントの本番環境における信頼性の低さは、ベンチマークの成功率が高水準であるにもかかわらず、長時間のマルチステップワークフローで顕著になる。本研究では、この乖離がタスクホライズン(依存ステップ数)の差に起因することを指摘し、9つのモデル(1.2Bから671Bパラメータまでの6つのオープンモデルと3つの商用システム)、4つのタスクファミリー、5つのホライズン、3つのコンテキスト条件を用いた大規模な統制実験を実施した。その結果、タスク成功率は単一のステップ信頼性パラメータに支配される幾何学的法則に従い、最強のモデルであっても信頼性が1を大きく下回るため、十分な長ホライズンでは必ず崩壊に至ることが示された。 Figure 1: ストリーミング系タスクにおけるモデルごとのタスク成功率とホライズン(依存ステップ数)の関係を示したグラフ。

関連研究

既存のLLM評価ベンチマークは、短〜中程度のホライズンに偏っており、高成功率が維持されやすい環境下で測定が行われてきた。本研究は、実際のプロダクション環境における要求ステップ数がベンチマークの水準を大きく上回っている点に着目し、ホライズンの長さがエージェントの挙動に与える影響を体系的に測定した先行研究の空白を埋めるものである。

新規性と貢献

本研究の最大の貢献は、エージェントの劣化がコンテキスト長の不足(ロスト・イン・ザ・ミドル等)ではなく、ステップ数の増加に直接起因することを実証した点にある。コンテキストウィンドウを制限すると減衰が緩和されるどころかむしろ急峻化することを示し(ロジット傾斜 -0.69 vs -0.44、p=3x10^-6)、従来の一般的な仮説に反証を挙げた。また、GAIA長ホライズンでの0.42から100ステップのプロダクション長ホライズンでの0.24へと、ベンチマークと実運用の間の乖離を定量化した。

提案手法の詳細

本研究では特定の新しいモデルアーキテクチャを提案するものではなく、厳密な統制実験を通じてエージェントの劣化メカニズムを解剖するアプローチをとっている。10,664件の分析済み軌跡データを基に、ツール使用ループを含むエージェントタスクにおいて、全てのテストモデル(商用システムを含む)が16ステップ以内にほぼ完全な成功状態からゼロ付近へと急落する現象を計測した。 Figure 2: 自然、圧縮、パディングの各コンテキスト条件下におけるステップ数とコンテキスト長の影響を比較したグラフ。

評価・考察

評価の結果、タスクの成功確率はステップごとの累積的な誤り伝播により幾何学的に低下することが判明した。モデルのスケールアップによってステップごとの信頼性は向上するものの、1未満で飽和するため、ステップ数が増加するにつれて破局的な失敗が保証される構造になっている。コンテキスト制限が減衰を緩和するという俗説に対し、実データに基づいて反証を示した意義は大きい。

応用例と今後の展望

本成果は、金融・カスタマーサポート・自動コーディング等の長時間自律エージェントを運用するシステム開発チームに対し、集約されたパス率指標の廃止と、ホライズンを考慮した評価・信頼性予算の導入を強く促すものである。今後は、多段階エージェントシステムにおけるエラー自己修復メカニズムや、ステップごとの信頼性を根本的に引き上げるためのアーキテクチャ設計が課題となる。

結論

LLMエージェントの長ホライズン劣化はコンテキスト長ではなくステップ数に支配される幾何学的崩壊であり、本番環境の信頼性確保には従来のベンチマーク指標を超えたホライズン単位の評価設計が不可欠である。

注釈

  • ホライズン: エージェントがタスクを完了するまでに経由する依存ステップの数。
  • 幾何学的崩壊: ステップ数が進むごとに一定の確率で失敗が掛け合わされ、指数関数的・幾何学的に成功率が低下する現象。