ツール呼び出し型 LLM エージェントの DoW 攻撃と防御──セッション最大 14,293 倍の入力肥大化を実証
外部ツールの出力を保持する永続的な請求可能状態を標的とした 6 つの攻撃ベクトルを導出し、ホスト側制御による防御手法を提案した。
リリース: 2026-09-23 · 読了 5 分論文概要
マルチステップのツール呼び出しを行う LLM エージェントにおいて、ホストランタイムがターンをまたいで状態を維持する仕組みを突いた Denial-of-Wallet (DoW) 攻撃のリスクが指摘された。本研究では、外部ツールの出力を後続のモデル入力に持ち越すことで生じる「persistent billable state(永続的な請求可能状態)」という概念を初めて定義し、6 つの攻撃ベクトルを導出している。実験用ベンチマーク DOW-BENCH を用いた評価では、最大でセッション初回の 14,293 倍もの入力トークンが消費されることが確認された。

関連研究
従来のエージェントセキュリティに関する研究は主にプロンプトインジェクションや不正なコード実行といった直接的な侵害に焦点を当ててきた。しかし、トークン課金モデルを前提としたリソース枯渇攻撃(Denial-of-Wallet)の文脈において、ツール出力の永続化とそれがもたらす再取り込み時の課金リスクについての体系的な分析は存在していなかった。本研究は、このポストアドミッション(承認後)のライフサイクルを初めて体系的にセキュリティ分析したものである。
新規性と貢献
本研究の主要な貢献は、persistent billable state という概念の定式化と、それに対するホスト側制御点(pre-reingestion boundary)の確立にある。未検証のツール出力が無制限に履歴へ蓄積されるメカニズムを解明し、決定論的な履歴変換と 4 つのホスト側不変条件を組み合わせた実用的な防御機構を提示した点に学術的・実用的な意義がある。
提案手法の詳細
ホスト側でツール出力を再取り込みする境界を厳格に管理するため、以下の 4 つのホスト側不変条件(invariant)を導入している。プロンプトの質量、コンテキストの成長率、再帰的機会、および再取り込み前の累積支出をバインドする設計を採用した。これにより、悪意あるツールが外部の信頼できないデータを自動的に再帰的処理の対象へ変換することを阻止する。

評価・考察
6 つのモデルファミリーを用いた DOW-BENCH(243 回のエグゼキューション)の評価において、未加工の履歴を保持し続けた場合、平均的な有効セッションコストが 21.2% から 35.9% 増加することが示された。また、圧縮手法は履歴依存のタスクにおいて各プロバイダで 10/12 または 11/12 の成功率を収めたのに対し、単純な削除では 2/12 に留まった。 Mistral Small 4 ワークフローを用いた検証では、提案された進捗承認ポリシーにより、固定上限を設けた場合の 13/24 を上回る 22/24 のオラクル検証済みタスク成功率を達成している。

応用例と今後の展望
本研究の成果は、金融機関や医療機関など、外部 API と連携する大規模な業務自動化エージェントを運用するシステム開発において直ちに参照すべきセキュリティ要件となる。特に、API 経由で多額の従量課金が発生する商用 LLM 環境を構築するテックリードやクラウドアーキテクトにとって、ツール出力のサニタイジングとコスト上限ガードレールの実装規模を見直す契機となる。調査された 3,830 件の Model Context Protocol (MCP) サーバーおよびトランスポートリポジトリのうち、コードレベルのセーフガードプロキシを露出していたのはわずか 71 件であり、全ファミリーをカバーしているものは存在しなかったため、エコシステム全体のセキュリティ底上げが急務である。
結論
本研究は、ツール呼び出し型 LLM エージェントにおける永続的な請求可能状態が深刻な DoW 攻撃の温床になることを示し、ホスト側での決定論的な制御と不変条件に基づく防御の有効性を実証した。
注釈
- Denial-of-Wallet (DoW): クラウドサービスや LLM の従量課金システムに対し、意図的に大量のリソースを消費させて金銭的な損害を与える攻撃手法。
- Model Context Protocol (MCP): AI モデルと外部データソースやツールを接続するためのオープン標準プロトコル。