RAGのSplit-Knowledge攻撃を検知するグラフ理論手法TopoGuard──既存比21倍の検知率を実証
retrieved文書間の意味的類似性をグラフ構造として解析することで、個別に無害な文書を組み合わせた攻撃を低レイテンシで検知する。
リリース: 2026-05-11 · 読了 5 分論文概要
RAG(Retrieval-Augmented Generation)システムにおいて、個別の文書は無害であっても、それらを組み合わせることで誤った情報を生成させる「Split-Knowledge攻撃」が新たな脅威となっている。本論文では、この攻撃を検知するために、検索された文書群から意味的な類似性グラフを構築し、悪意のあるトポロジーを特定する「TopoGuard」を提案した。実験の結果、HotpotQAデータセットにおいて、LlamaGuard-2-8Bと比較して1%のFPR(偽陽性率)下で21倍の検知率(32.6% vs 1.5%)を達成した。

関連研究
従来の防御手法であるLlamaGuardのような per-document(文書単位)フィルタは、各文書を独立して評価するため、複数の文書を組み合わせた際に発生する構造的な悪意を検知できない。本研究は、この構造的な脆弱性を初めて指摘し、グラフ理論を用いたアプローチで解決を図るものである。
新規性と貢献
- RAGにおけるSplit-Knowledge攻撃という新たな脅威モデルの定義。
- グラフ理論を応用し、文書間の関連性をトポロジーとして解析することで、文脈的な悪意を検知する手法の提案。
- LLMを用いた既存の検知システムと比較して、サブミリ秒単位の極めて低いレイテンシでの動作を実現。
提案手法の詳細
TopoGuardは、検索された文書群をノードとし、意味的類似性をエッジとするグラフを構築する。このグラフ上で、特定の悪意あるパターン(攻撃者が意図した誤った関連付け)を示すトポロジーを検出する。
- なぜグラフか:個々の文書には悪意が含まれていないため、従来のテキスト分類器では検知できない。文書間の関係性(構造)にこそ攻撃の痕跡が隠れているため、グラフ理論が最適である。
- 実装:TopoGuard-λ2+Entityなどのバリエーションにより、計算負荷を抑えつつ、ノイズの多い入力に対してもロバストな検知が可能である。
評価・考察
HotpotQAを用いた評価では、LlamaGuard-2-8Bを大幅に上回るリコールを記録した。また、レイテンシの面でも、LLMベースの検知器が数百ミリ秒を要するのに対し、TopoGuardはサブミリ秒で動作する。

応用例と今後の展望
本手法は、金融や医療といった、機密文書を扱うRAGシステムにおけるセキュリティ基盤として極めて有用である。特に、リアルタイム性が求められるカスタマーサポート向けRAGや、大規模な文書検索を伴うシステムにおいて、LLMの推論コストを上げることなくセキュリティを強化できる点が、日本のエンジニアにとっての実務インパクトとなる。
結論
TopoGuardは、RAGにおける構造的な攻撃を検知するための効率的かつ高精度な手法である。グラフ理論に基づくアプローチは、LLMの推論に依存しないため、スケーラブルな防御層として機能する。
注釈
- Split-Knowledge攻撃: 複数の文書に情報を分散させ、それらを組み合わせることでモデルに誤った推論をさせる攻撃手法。
- FPR (False Positive Rate): 誤検知率。本来無害なものを悪意があると判定してしまう割合。