🧠Research🔥🔥

Google、探索ポリシー効率化フレームワーク Dream-RSI を発表──エージェント呼び出し回数を最大 162 倍削減

過去の探索ツリーを決定論的リプレイ環境として再利用することで、モデルを固定したまま探索ポリシーのみをゼロコストで最適化する。
リリース: 2026-09-16 · 読了 3

記事の要約

1. 核心(What)

  • Google、Google DeepMind、UMD、UVA の研究チームが、AI エージェントの探索効率を改善するフレームワーク「Dream-RSI」を発表した。
  • Lasso パス探索において、SimpleTES と同等の精度を維持しつつエージェント呼び出し回数を約 162 倍削減することに成功した。
  • KernelBench において、同等予算比で 1.44 倍から 2.09 倍の高いパフォーマンスを記録、または 1.79 倍から 2.43 倍少ない生成数で目標速度に到達した。
  • 基盤となるコーディングエージェントのモデルは固定したまま、分岐・バッチ処理・停止を制御する小規模な実行可能ポリシーのみを更新する仕組みを採用している。

2. 影響(Why)

  • API コストと計算リソースの圧倒的な削減: 探索プロセスにおける高価なエージェント呼び出しを最大 2 桁削減できるため、大規模なコード生成やアルゴリズム探索を伴う開発の実験コストを桁違いに引き下げられる。
  • 国内 AI 開発チームへの現実的なコスト解: [国内 AI 受託開発・SaaS 企業] のように自社で複雑なコード生成やパラメータ探索のエージェントを回す現場では、API 費用の圧迫を抑えながら探索の試行回数を増やすための有力なベースラインとなる。

3. 根拠・詳細(How)

  • 過去の探索ツリーを用いたリプレイ環境: 完了した探索ランから得られたコード試行結果・評価スコア・ワークステート・コストの履歴を決定論的リプレイシミュレータとして再利用し、代替ポリシーを検証する。
  • 評価コストの物理的な切り離し: 候補プログラムの再実行や高価なコーディングエージェントの呼び出しを回避しつつ、記録されたノードの順序変更やバッチサイズ変更のスコアリングをゼロコストで実行する。

4. 展望・課題(Next)

  • GitHub でのリファレンスコード公開準備: 現在、公式プロジェクトページ (dream-rsi.com) が公開されており、GitHub でのリファレンスコード公開に向けて準備が進められている。