Odyssey、マルチエージェント学習とワールドモデル修正を同時実行するフレームワーク PROWL-2 を公開──SMACv2 で 91% の相対改善を達成
シミュレータの誤差を自動検出する Fidelity Gate により、モデルベース強化学習のハルシネーションと方策崩壊を抑制する。
リリース: 2026-10-01 · 読了 3 分記事の要約
1. 核心(What)
- Odyssey がマルチエージェント学習とワールドモデルの協調訓練フレームワーク PROWL-2 をリリースした。
- SMACv2 の 9 シナリオすべてでベースラインのワールドモデル学習者と比較して最大 91% の相対改善を達成した。
- マルチエージェント四足歩行環境において、Gate-3 での 600,000 ステップ時点の成功率が 0% から 20% 超へ、150 万ステップ時点では約 70% に到達した。
- Fidelity Gate が高優先度の開始状態から記録された行動を再生し、誤差の閾値を超えた軌跡を方策訓練から除外してモデル修復に回す。
2. 影響(Why)
- シミュレータ誤差の伝播防止: モデルベース強化学習では長時間の予測が誤差を増幅させるが、Fidelity Gate で不正なロールアウトを排除するため、実環境転移時の破綻を防げる。
- マルチエージェント協調の安定化: 個別のポリシー変更による環境のドリフトに対し、タスク方策とワールドモデルを別個のカリキュラムで最適化することで、複雑な協調行動の学習精度が高まる。
3. 根拠・詳細(How)
- Fidelity Gate による軌跡検証メカニズム: 実環境の保存された開始状態から記録された行動をワールドモデルで再実行し、シミュレーション結果と実データを比較して誤差閾値を超えるものをモデル修復キューに送る。
- 二重カリキュラム構造の仕様: 学習ポテンシャルに基づいてタスクの開始状態を優先順位付けするタスク方策カリキュラムと、モデルが予測しにくい軌跡を探索する開発者エージェントによるワールドモデルカリキュラムを分離している。
4. 展望・課題(Next)
- 物理デプロイ時の制約: 実機展開時はセンサーノイズや部分的観測可能性が加わるため、シミュレータ外での安全制約を含めた追加検証が必要となる。