📜Papers🔥🔥

マルチエージェントLLMの計画フェーズを狙う攻撃手法PlanFlip──GPT-5で成功率0.68を記録

Plannerへのプロンプトインジェクションにより下流タスクを連鎖的に汚染する攻撃手法を提案し、同種モデル構成の脆弱性を実証した。
リリース: 2026-04-30 · 読了 5

論文概要

マルチエージェントLLMシステムにおいて、タスクを分解する「Planner」へのプロンプトインジェクション攻撃が、下流のExecutorやCriticを含むシステム全体を汚染するリスクを指摘した研究。提案手法「PlanFlip」は、ツール出力に見せかけた4種類のインジェクション(GoalSubstitution, PriorityInversion, ContextPollution, RoleConfusion)を実行し、9つのフロンティアモデルに対して検証を行った。

Figure 1: PlanFlipの脅威モデルと防御策を示すアーキテクチャ図。

関連研究

従来、LLMのプロンプトインジェクションは単一エージェントを対象としたものが中心であった。本研究は、タスク分解を行うPlannerが介在するマルチエージェント環境において、攻撃が連鎖的に増幅される「カスケード増幅」という新たな脅威を定義した点で先行研究と一線を画す。

新規性と貢献

本研究の主な貢献は、Plannerへの攻撃がシステム全体を無力化するメカニズムを解明したことにある。特に、強力なモデルほど攻撃に脆弱であるという逆説的な事実を突き止め、同種モデルのみで構成されたパイプライン(Homogeneous pipeline)が持つ「相関エージェントの盲点」を明らかにした。

提案手法の詳細

PlanFlipは、Plannerのコンテキストに不正な指示を注入する4つの攻撃手法で構成される。これらはツール出力の形式を模倣することで、キーワードベースのフィルタリングを回避する。なぜこの設計かといえば、Plannerが外部ツールからの入力を信頼してタスク計画を再構築する性質を悪用するためである。

Figure 2: 各攻撃タイプにおけるモデルごとのASRとStealthの相関を示す散布図。

評価・考察

3,479エピソードの実験により、以下の結果が得られた。

  1. 能力と脆弱性の相関: GPT-5はASR(攻撃成功率)0.68を記録し、モデルの推論能力が高いほど攻撃を受け入れやすいことが判明した。
  2. 同種パイプラインの盲点: GPT-4oやLlama-3.3-70Bを用いた構成では、Criticが攻撃による計画の歪みを検知できず、攻撃がステルス化する現象が確認された。
  3. 推論強化モデルの耐性: DeepSeek-R1は全ての攻撃に対してStepShift(計画の逸脱度)0.00を維持し、推論プロセスを明示するモデルの堅牢性が示された。

Figure 3: 各モデルにおける防御策(D1, D2)の検出率(DR)を比較したグラフ。

応用例と今後の展望

本研究は、マルチエージェントシステムの設計において、異種モデル(Heterogeneous models)を組み合わせる「モデル多様性」がセキュリティの前提条件であることを強く示唆している。日本の金融や医療分野でマルチエージェントLLMを導入する際、単一のモデルバックボーンで構築するのではなく、PlannerとCriticに異なるアーキテクチャを採用することが実装上の必須要件となる。

結論

Plannerへのインジェクション攻撃はマルチエージェントシステムにとって致命的な脅威である。多様なモデルの組み合わせと、GoalAnchorCheck等の検証手法を導入することで、初めて実用レベルのセキュリティを担保できる。

注釈

  • Planner: 全体目標をサブタスクに分解するエージェント。
  • ASR (Attack Success Rate): 攻撃が意図通りにシステムを操作できた割合。
  • Stealth: 攻撃がシステム内の監視メカニズム(Critic)に検知されなかった度合い。