🧠Research🔥🔥

MIT CSAIL、RLM を用いた推論ハネスによる長文脈汎化手法を公開──短文学習モデルで 8-32 倍のタスクを処理

モデルのパラメータを増やす前に、ReAct 等のループ構造が引き起こすコンテキストドリフトを解消するハネス設計が長文脈性能を左右する。
リリース: 2026-07-23 · 読了 5

記事の要約

1. 核心(What)

  • MIT CSAIL の Alex Zhang と Omar Khattab が、モデルの推論ハネス(周辺実装)を最適化することで長文脈対応力を 8-32 倍に拡張する研究を発表した。
  • Chroma の調査によると、検証した 18 種類のフロンティアモデルすべてで、コンテキスト長が増大するにつれて性能が低下する「コンテキスト腐敗(Context Rot)」が確認された。
  • ReAct 等の既存エージェントループは、全ての推論ステップをプレフィックスに連結するため、モデルの学習時分布から逸脱するドリフトが発生する。
  • Recursive Language Model (RLM) は、Bulk データをコード環境の変数にオフロードし、モデルにコードを書かせることで入力を学習分布内に維持する。

2. 影響(Why)

  • モデル増強の誤謬を脱却する: 長文脈での性能低下をモデルのパラメータ不足と断定してスケールアップに走るのではなく、ハネスの設計を見直すことで、既存の小規模モデルでも長大なタスクを安定して処理可能になる。
  • 国内 SaaS 開発への示唆: 大規模なログ解析や文書要約を行う国内の Vertical SaaS 開発者は、単にコンテキストウィンドウの広いモデルへ乗り換えるより、RLM 的なコードオフロード基盤を構築する方がコストと精度の両面で優位になる。

3. 根拠・詳細(How)

  • RLM による分布維持の機構: 入力を単なるテキスト連結ではなく、コード環境の変数として保持し、モデルには「データをスライス・クエリするコード」を書かせることで、ルートプロンプトを常に学習時と同じ分布(Locally In-Distribution)に固定する。
  • タスクの同型性(Isomorphism)活用: 異なるドメインのタスクであっても、データチャンク化とファンアウト処理という共通のプログラム構造に落とし込むことで、短文学習モデルであっても 8-32 倍の長文脈タスクで同等の汎化性能を発揮する。

4. 展望・課題(Next)

  • エージェント基盤の再設計: ReAct や Claude Code 等の既存エージェントフレームワークにおいて、観測結果をすべてプレフィックスに蓄積する従来の設計から、REPL への変数保持モデルへの移行が課題となる。