📜Papers🔥🔥

LLM エージェントの構造化メモリーにおける忘却制御手法 SF-AMS──マルチホップ推論で F1 スコア 9.65 向上を達成

メモリー単位の重要度を動的ユーティリティ信号でモデル化し、冗長情報を排除する SF-AMS により、Qwen2.5-7B で既存手法比 9.65 F1 の向上を実現した。
リリース: 2026-05-29 · 読了 5

論文概要

LLM エージェントの長期コンテキスト処理におけるボトルネックとして、冗長および無関係な情報がマルチステップ推論の精度を低下させる問題がある。本論文では、メモリー単位の長期的な重要度をモデル化し、コンパクトで高ユーティリティなメモリーを維持するフレームワーク「Strategic Forgetting for Agent Memory Systems (SF-AMS)」を提案する。SF-AMS は静的な検索やヒューリスティックな減衰を置き換え、使用の冗長性と時間的シグナルからメモリーの重要度を更新する「ユーティリティ駆動型生存メカニズム」を採用する。LoCoMo および LongMemEval-s での実験により、LightMem、MemO、A-Mem などの強力な SOTA ベースラインに対して一貫したゲインを示している。最大改善は Qwen2.5-7B を用いたマルチホップ推論で達成され、最強のベースラインと比較して +9.65 F1 を記録した。

Figure 1: SF-AMSフレームワークの全体構成と4つのステージを示す概要図。

関連研究

LLM エージェントのメモリー管理においては、外部データベースを用いた検索拡張生成(RAG)や、会話履歴を要約・蓄積する手法(例: LightMem, MemO, A-Mem)が多数提案されてきた。しかし、従来の多くのアプローチは静的な保持や単純な時間減衰、あるいは単純なセマンティック類似度に依存しており、タスクの進行に伴いコンテキストが冗長な情報で汚染される課題があった。本研究では、メモリーの重要度を動的なユーティリティ信号としてモデル化し、構造化された階層的メモリーを構築する点で従来手法と異なる。

新規性と貢献

本研究の主要な学術的・実用的な貢献は以下の通りである。第一に、静的な検索やヒューリスティックな削除に頼らず、使用頻度の冗長性や時間的シグナルから生存メカニズムを動的に駆動する枠組みの導入である。第二に、セマンティックレベルとエンティティレベルのシグナルを統合する Composite Importance Scoring により、検索の頑健性を高めた点である。第三に、Qwen2.5-7B や GPT-4o-mini などの異なるバックボーンモデルにおいて一貫したクロスモデル汎化性能を示した点である。

提案手法の詳細

SF-AMS は、メモリーの重要度を動的に更新してノイズをフィルタリングし、安定したエンティティ整合性を持つ情報を優先する階層的メモリー構造を構築する。具体的には、Composite Importance Scoring を通じて意味的シグナルと実体レベルのシグナルを統合する。これにより、エージェントが過去のやり取りからタスクに真に必要なコンテキストのみを選択的に保持し、不要になった情報を戦略的に忘却(Strategic Forgetting)する設計となっている。

Figure 3: SF-AMSにおける階層的メモリー蒸留プロセス(Core、Important、Secondary、Irrelevant)の可視化例。

評価・考察

LoCoMo および LongMemEval-s ベンチマークを用いた実験の結果、SF-AMS は強固なベースラインを上回る成績を収めた。Qwen2.5-7B を用いたマルチホップ推論タスクでは最強ベースライン比で +9.65 F1 の最大向上を達成した。さらに、GPT-4o-mini を用いた時間的推論(Temporal Reasoning)タスクで +6.91 F1、オープンタスクで +6.53 F1 の改善が確認されている。

Figure 2: LoCoMoデータセットにおけるアブレーションスタディのF1スコア比較を示すグラフ。

応用例と今後の展望

長期間にわたるユーザーとの対話や、多数のドキュメントをまたぐマルチステップ推論を要するエンタープライズ向けカスタマーサポートシステムや、自動化されたソフトウェア開発エージェントの構築において直接的な実務インパクトを持つ。特に数千トークン規模のコンテキストを常時保持・更新する必要がある国内の金融・医療分野における対話型 AI 開発において、コンテキスト肥大化と精度低下を防ぐ実装上の有力な選択肢となる。今後の課題として、より複雑なドメインやマルチモーダル情報への拡張が挙げられる。

結論

本論文では、LLM エージェントの長期コンテキスト処理における冗長情報の課題に対し、動的なユーティリティ信号に基づく戦略的忘却メカニズム(SF-AMS)を提案した。複数のベンチマークにおける数値的優位性と、クロスバックボーンでの汎化性能が実証されており、メモリー管理設計における重要な指針を提供する。

注釈

  • マルチホップ推論: 複数の異なる情報源を段階的につなぎ合わせて結論を導き出す推論プロセス。
  • F1スコル: 精度(Precision)と再現率(Recall)の調和平均であり、予測の正確さを測る指標。