📜Papers🔥🔥

物理コーディングによる自己進化型ロボットエージェント HexaAnything──RoboCasa365 で既存 VLA モデルを上回る成功率を実証

タスク状態と制御を明示的なコードとして表現する物理コーディング手法を提案し、RoboCasa365 ベンチマークで既存の XR-1 VLA を上回るタスク成功率を達成した。
リリース: 2026-09-28 · 読了 5 分

論文概要

視覚・言語・行動(VLA)モデルや世界行動モデル(WAM)は、観測や指示を直接ロボットの行動にマッピングするアプローチをとってきた。しかし、この直接的な対応付けは環境のレイアウトや視点のわずかな変化に対する脆弱性を生む。本論文では、タスクの状態や実行手順を明示的な「コード」として表現・管理する物理コーディング手法を提案する。著者らはエージェントシステム「HexaAnything」を構築し、RoboCasa365 ベンチマークの Composite-Unseen スプリットや PhyBench において、既存の XR-1 VLA モデルを上回る成功率を実証した。

Figure N: 物理コーディングの概念を示す図1:Code as WorldとCode as Policyが相互に連携し、エージェントが物理環境とやり取りするインターフェースを形成する。

関連研究

従来のロボット制御では、大規模な実世界データセットを用いたエンドツーエンドの VLA 学習が主流であった。しかし、タスク要件や進捗状況、失敗からのリカバリがアクションシーケンスの内部に暗黙的にエンコードされるため、人間が検証・修正することが困難であるという課題があった。デジタル領域におけるコーディングエージェントは、LLM がツールを呼び出し、結果を検証し、フィードバックからコードを修正する仕組みで高い汎化性能を示しており、本研究はその枠組みを物理世界へ拡張するものである。

新規性と貢献

本研究の最大の新規性は、物理世界におけるタスクの状態とポリシーを「コード」として定義・処理する「Physical Coding」の導入にある。これにより、試行結果の検証トレースがそのままデータやメモリとなり、モデルの重みやアーキテクチャ、さらにハードウェア設計に至るまでの自己進化サイクルを駆動できる点が学術的・実用的な貢献である。

提案手法の詳細

提案手法は大きく「Code as World」と「Code as Policy」の 2 つのコンポーネントで構成される。Code as World はオブジェクト、関係性、制約、進捗状況を記録し、Code as Policy は計画、検証、リカバリ、実行を組織化する。HexaAnything は、VLA/WAM ポリシーを含む知覚・計画・制御ツールを呼び出し、外部フィードバックからループ内で動的な意思決定を行う。

Figure N: 物理的自己進化の全体像を示す図4:バージョン管理されたアーティファクトと7つのオペレーションを通じた継続的な改善ループ。

評価・考察

RoboCasa365 ベンチマークを用いた実験において、HexaAnything は Composite-Unseen スプリットを含むすべての評価軸で従来の XR-1 VLA モデルを上回る成功率を記録した。また、Harness 学習を適用した HexaModel は、ベースモデルに対してすべてのスプリットで性能向上が確認されており、コードの実行トレースが物理的実行の内部化に寄与していることが示されている。

Figure N: ロボットマニピュレーションタスクにおける成功率の比較を示す図7:RoboCasa365ベンチマークの各種スプリットにおける性能向上。

応用例と今後の展望

本手法は、製造業における組立ラインの自律的な段取り替えや、科学実験室における物理実験の自動化など、複雑な手順と環境変化が伴う実世界タスクへの適用が期待される。日本の製造業・ロボティクス研究分野において、多品種少量生産を行う現場でのマニピュレーション制御の信頼性を向上させるための実装基盤として、実務インパクトを持つ可能性がある。今後の課題としては、モデルの重みへの完全な内部化や、アーキテクチャおよびタスク設計の自律的再設計が挙げられている。

結論

本論文は、物理環境におけるタスク状態と制御をコード化する物理コーディング手法を提案し、エージェントの自己進化メカニズムを通じてロボットマニピュレーションの汎化性能と成功率が大幅に向上することを実証した。

注釈

  • VLA (Vision-Language-Action): 視覚入力と自然言語の指示からロボットの制御行動を直接出力する機械学習モデル。
  • WAM (World-Action Model): 環境の動的な変化を予測しながら行動を生成するモデル。