📜Papers🔥🔥

OpenWAM: モジュール型 World-Action Model の事前学習基盤と OpenWAM-α の実証

World-Action Model の設計空間を分解するモジュール型基盤 OpenWAM を提案し、約 6,400 時間のデータで事前学習した OpenWAM-α でシミュレーションおよび実ロボット実験における優れた汎化性能を実証した。
リリース: 2026-09-07 · 読了 5

論文概要

本論文は、動画生成事前学習からの知識継承とロボットの実行可能制御信号への変換を行う World-Action Model (WAM) の設計空間を体系的に検証するためのオープンソース研究基盤「OpenWAM」を提案するものである。従来の WAM は生成バックボーンやビジュアル表現、アーキテクチャが密結合されたモノリシックな構成であったが、OpenWAM はこれらをモジュール化し、統一された枠組みで実験・評価を可能にした。約 6,400 時間のエゴセントリック(一人称視点)人間データおよびロボットデータを用いて事前学習されたモデル「OpenWAM-α」は、8 つのシミュレーションベンチマークおよびシングルアーム・バイマニュアル・多関節ハンドを含む実ロボット実験を通じて、一貫して優れた性能を発揮することが示されている。

関連研究

従来、ロボット制御のための事前学習では、大規模なインターネット上の動画データやエゴセントリックデータから視覚的知識を抽出し、それをロボット操作に適用するアプローチが模索されてきた。しかし、既存のシステムはモデル構造がブラックボックス化しやすく、どの設計要素が性能の向上に寄与しているかの切り分けが困難であった。本研究は、モジュール型の設計空間を構築することで、個別の設計要素が果たす役割を制御実験によって明確に分離・検証する点で先行研究と一線を画す。

新規性と貢献

主な貢献は以下の通りである。第一に、WAM の設計空間を統一的なモジュールに分解した研究基盤「OpenWAM-Infra」の構築。第二に、「何を継承すべきか」「世界知識と行動学習の相互作用」「それらのスケーリング則」という 3 つの問いに対する制御実験を通じた原則の抽出。第三に、約 6,400 時間の多様なデータで事前学習され、シミュレーションから実世界までトップティアの性能を維持する「OpenWAM-α」のオープンソース化である。

提案手法の詳細

OpenWAM では、生成バックボーン、ビジュアル表現、情報フロー、推論手順、学習データの各要素を分離・構成可能なモジュールとして設計している。抽出された原則として、上流からの知識転移には十分な能力を持つ生成バックボーンとコンパクトで情報量の豊富な潜在空間が必要であること、世界知識と行動の相乗効果には専用の行動容量、明確な世界から行動への情報フロー、および同期された結合デノイジングが不可欠であることが示されている。また、一人称視点データとロボットデータを統合した一段階の共学習(Co-training)が、ドメイン外汎化性能を顕著に向上させることが明らかにされている。

評価・考察

OpenWAM-α は、シングルアームからバイマニュアル、多関節器用ハンドに至る多様な身体性(Embodiment)を網羅する 8 つのシミュレーションベンチマークおよび実ロボット環境で評価された。結果として、シミュレーションと物理世界の双方で一貫してトップクラスの性能を維持し、エゴセントリックデータとロボットデータの統合がドメイン外汎化の向上に大きく寄与することが定量的に確認された。

応用例と今後の展望

実世界における多種多様なマニピュレーションタスクや、複雑な把持・操作を行うロボットシステムの基盤モデルとして直ちに応用可能である。日本の製造業や物流分野における高度な自律ロボット開発において、オープンソース化されたインフラ、評価プロトコル、データレシピを活用することで、独自モデルの検証・構築コストの大幅な削減が期待される。今後の課題は、さらに大規模なデータセットへのスケーリングと、実時間推論におけるレイテンシの最適化にある。

結論

本論文は、WAM の設計空間をモジュール化して体系的に解明したオープンソース基盤 OpenWAM を提示し、OpenWAM-α の優れた汎化性能を実証した。コードや事前学習済みモデルの公開により、今後の身体性 AI 研究の発展に大きく寄与することが期待される。

注釈

  • World-Action Model (WAM): 動画生成事前学習によって獲得した世界知識を、ロボット等の物理的な実行可能制御信号へと統合・変換するモデルアーキテクチャ。
  • エゴセントリックデータ: ヘルメットカメラやウェアラブルデバイス等による、人間視点(一人称視点)の映像データ。