長文脈インタラクションを実現するビデオ世界モデル SolarWM ── 143万クリップの統合データエンジンと5B-33Bモデル群をオープン化
異種データと多様なバックボーンを統合するデータエンジンと3段階の学習レシピにより、5秒の訓練から数分から数時間の長期ロールアウトを可能にするビデオ世界モデル群を実現した。
リリース: 2026-09-02 · 読了 5 分論文概要
本論文では、インタラクティブなビデオ世界モデル(World Model)の構築に向けた完全オープンな基盤「SolarWM」を提案している。異種データソースや多様なビデオ生成バックボーンを統合し、わずか5秒の短縮シーケンスの訓練から数分から数時間に及ぶ長期ロールアウト(長文脈推論)を実現した。10のデータセットから抽出された143万件の標準クリップを利用する再構成可能なマルチソースデータエンジン、およびWan2.2、LTX-2.5、MiniMax-H3をベースとした5Bから33B規模の4つのモデル群を公開している。
関連研究
従来のビデオ世界モデルやビデオ生成の研究では、データセット間の時間スケール、カメラジオメトリ、視覚的品質、モーション、キャプションスタイルの不一致や、ビデオジェネレータ固有の表現・アーキテクチャの違いがボトルネックとなっていた。ナイーブなデータ混合やモデル個別実装では一貫した教師信号が得られず、再現性や比較が困難という課題があった。SolarWMは、データ処理とミックス構築を分離するアプローチにより、この結合問題に直接アプローチしている。
新規性と貢献
主要な貢献は、再構成可能なマルチソースデータエンジンによる 143万件のフレーム整合データ契約(視覚観測、メトリックカメラジオメトリ、キャプション、品質メタデータ等)の構築と、バックボーン非依存の適応フレームワークの確立である。これにより、固有の表現や目的関数を維持したまま、Wan2.2やLTX-2.5などの異なるバックボーン上でスケーラブルな世界モデルを構築できる点が最大の新規性である。
提案手法の詳細
SolarWMは、統一された3段階の学習レシピを採用している。まず双方向適応(Bidirectional Adaptation)を行い、次に教師強制による自己回帰初期化(Teacher-forced Autoregressive Initialization)、そして分布マッチング蒸留(Distribution Matching Distillation)を組み合わせる。この設計により、カメラ条件付け、訓練、推論インターフェースを共有しつつ、5秒の短いシーケンスでの訓練から実時間を超えた長時間のインタラクションを可能にする因果モデルへと拡張している。
評価・考察
本論文では Wan2.2、LTX-2.5、MiniMax-H3 をベースとした 5B から 33B パラメータの 4 つのモデルをインスタンス化し、その有効性を実証している。5秒のシーケンスを用いた訓練データから、数分から数時間の長期ロールアウトにおける安定したリアルタイムインタラクションを達成しており、オープンな世界モデル研究の再現性と拡張性を大きく引き上げている。
応用例と今後の展望
自動運転のシミュレーション、ロボティクスの環境予測、高度なゲームAIやエンターテインメント領域におけるインタラクティブな物理世界のシミュレーションへの応用が期待される。日本の自動車メーカーやロボティクス関連企業、ゲーム開発スタジオにおいて、独自データを用いた大規模な世界モデルの検証・ファインチューニング基盤としての実務インパクトが見込まれる。
結論
SolarWMは、データ準備から長文脈推論に至るまでの一貫したオープンなビデオ世界モデル基盤を提示した。143万クリップのデータエンジン、3段階の学習レシピ、および複数の強力なバックボーンに基づくモデル群の公開により、今後のインタラクティブ世界モデル研究の標準的な土台を提供する。
注釈
- ビデオ世界モデル: AIが物理法則や空間構造を学習し、次に入力される映像やアクションに対する環境の変化を予測・生成するモデル。