マルチエージェント動画生成の論理一貫性を高める WorldState Registers 搭載拡散モデル WorldWeaver
学習可能なワールド状態レジストリと Mixture-of-Transformers 設計により、複数視点・複数エージェント環境での動画生成の整合性を大幅に改善。
リリース: 2026-07-23 · 読了 5 分論文概要
マルチエージェントおよび複数視点環境におけるインタラクティブな動画生成では、エージェント間で共有されるワールド状態の永続性と視点間の整合性が課題となる。従来の自己回帰型ビデオ拡散モデルは観測履歴を条件付けのコンテキストとして引き継ぐため、複数エージェント間での共有状態の維持が困難であった。本論文では、ロールアウトをクロスエージェントワールド状態レジストリで拡張したストリーミングマルチエージェントビデオ拡散モデルである WorldWeaver () を提案する。
関連研究
既存のビデオ拡散モデルは単一エージェントや固定視点での予測に特化しており、複数エージェントが相互作用する複雑な環境や、動的に変化する大域的なワールド状態を明示的にトラッキングする仕組みを持っていなかった。本研究は、共有状態の管理をトークンベースのレジストリとしてモデル構造に組み込むことで、この制限を克服する。
新規性と貢献
本研究の主要な貢献は、学習可能なトークン群を用いて共有ワールド情報を保存し、個々のエージェントの状態を追跡する「ワールド状態レジストリ」の導入にある。これにより、生成されたチャンクごとに動的な更新が行われ、論理的整合性と生成品質が向上する。また、個別のエージェントステータス、鳥瞰図を含む大域的状態、シーンテキストにわたるスーパービジョン信号により、レジストリの頑健性を担保している。
提案手法の詳細
WorldWeaver () は、ストリーミング形式でマルチエージェントの動画生成を実行する。
提案手法では、ワールド状態モデルとビジュアルフレームモデルに別々の重みを使用する Mixture-of-Transformers 設計を採用しており、共有状態のモデリングと高精細な視覚表現の学習を分離・最適化している。これにより、エージェント間での状態の不整合を防ぎながら効率的な推論を実現する。
評価・考察
2エージェントの Minecraft ビデオ生成における網羅的な実験を通じ、明示的なワールド状態モデリングの導入が論理的整合性と生成品質の向上に寄与することが示されている。
定性的評価において、複数エージェント間の相互作用や視点変更に伴う破綻が抑制されていることが確認された。
応用例と今後の展望
本手法の応用領域として、高度なゲームAI開発や、複数視点カメラを用いた自動運転シミュレーションが挙げられる。エンターテインメントやロボティクス分野における大規模シミュレータの実装において、マルチエージェントの相互作用を伴う環境構築の効率化に寄与する。今後の課題としては、より多様かつ複雑な実世界ドメインへのスケーラビリティ検証が必要である。
結論
WorldWeaver は、マルチエージェントビデオ拡散モデルにおいてワールド状態レジストリと Mixture-of-Transformers を組み合わせることで、複数視点・エージェント間の論理的整合性を大幅に改善できることを実証した。
注釈
- Mixture-of-Transformers: 異なる役割を持つ複数の Transformer ブロックを組み合わせ、特定のタスクに特化した重みを使い分けるアーキテクチャ設計手法。
- ワールド状態レジストリ: エージェント間での共有情報や状態を動的に保持・更新するための学習可能なトークン群。