エージェントのハーネスを 5 つのモジュールに分解して自己進化させる ModularRSI──TB2.0 や SWE-Bench Verified で汎化性能を実証
エージェントハーネスの再帰的自己改善において、ベンチマーク非依存な 2,000 タスクとモジュール単位の独立進化により、未知のドメインや異なる基盤モデルへの高い転移性を実現した。
リリース: 2026-09-14 · 読了 5 分論文概要
長文脈のコーディングやターミナル操作を行う AI エージェントの実行機構(ハーネス)を、経験を通じて再帰的に自己改善させる手法において、汎化性能の課題を克服する新しいフレームワーク「ModularRSI」が提案された。従来の再帰的自己改善(RSI)は評価用ベンチマークへの過学習や、単一の軌跡に基づく更新によるノイズ混入、そしてモノリシックなハーネス構造における原因特定の難しさに直面していた。ModularRSI は、ベンチマークから独立した 2,000 件の実行可能タスクと、ハーネスを 5 つの機能モジュールに分割して独立進化させる設計により、TB2.0 および SWE-Bench Verified において未見のドメインや異なる基盤モデルに対しても一貫した性能向上を実証している。

関連研究
近年、LLM をベースとした自律エージェントの実行ループやプロンプト、ツール利用機構を動的に改善する試みが進められている。しかし、既存手法の多くは特定の評価データセットの内部で最適化を行うため、ベンチマーク固有のパターンへの適応にとどまり、未知のタスクへの転移性が低いという根本的な問題があった。また、単一の実行失敗例から直接システム全体を修正しようとすると、タスク特有のノイズと構造的な欠陥の切り分けが困難になるという課題があった。
新規性と貢献
本研究の最大の貢献は、①評価用ベンチマークから完全に独立した 2,000 件の進化用タスクの構築、②成功例と失敗例の対比による体系的な行動欠陥の抽出、③ハーネスのモジュール単位での独立進化と統合ステージの導入、という 3 点にある。これにより、特定のベンチマークに過学習することなく、実用的なソフトウェア工学タスク全般で汎用的に機能するエージェントハーネスの自己進化を可能にした。
提案手法の詳細
ModularRSI は、エージェントのハーネスを以下の 5 つの機能モジュールに分解して管理する。
- Agent Loop
- Tool Use
- Observation Management
- Context Management
- Task Completion Detection

各モジュールは制限された修正スコープ内で独立して進化を行う。その後、統合ステージにおいて進化済みモジュールを一つのハーネスに再結合し、モジュール間の競合を解決する仕組みを採用している。さらに、同一タスクにおける成功軌跡と失敗軌跡を対比し、複数タスク間でエビデンスを集約することで、単発のノイズに惑わされず反復する行動上の欠陥を正確に特定する。

評価・考察
TB2.0 および SWE-Bench Verified を用いた実験において、ModularRSI によって進化したハーネスは、ドメイン内およびクロスドメインの未見タスクに対して一貫した改善を示した。また、特定の基盤モデルに依存せず、異なる基盤モデル間でも進化後のハーネスが正常に転移することが確認されており、モジュール分割による抽象化と競合解決メカニズムが有効に機能していることが裏付けられている。
応用例と今後の展望
ソフトウェア開発支援ツールの開発や、複雑なターミナル操作を伴う自動デバッグシステムの構築において、エージェント基盤の信頼性を継続的に高める基盤技術としての応用が期待される。特に国内のソフトウェア開発企業やテックリード層にとって、自社固有の開発環境やリポジトリ構成に対応した自律型コーディングエージェントのハーネスを、評価ベンチマーク汚染のリスクなしに自動チューニングするための実践的なアプローチを提供する。今後の課題としては、より多様な実世界タスクへのモジュール拡張や、統合ステージにおける競合解決のオーバーヘッド削減が挙げられる。
結論
ModularRSI は、エージェントハーネスの再帰的自己改善において課題であった「ベンチマーク過学習」「ノイズ混入」「モノリシック構造の限界」を、独立した 5 モジュールへの分解とベンチマーク非依存な対比学習によって解決した。汎用性と転移性に優れたエージェント進化の新たな標準を示す成果である。
注釈
- エージェントハーネス: LLM を外部ツールや環境と連携させ、一連のタスクを自律的に遂行させるための実行制御機構。
- 再帰的自己改善 (RSI): AI システム自身が自身の性能や構造を評価・修正し、世代を重ねて高度化していくプロセス。