📜Papers🔥🔥

視覚言語モデルを拡張した物理基盤モデル PhysBrain 1.5──28の embodied ベンチマークで平均スコア 72.5 を達成

汎用 VLM をベースに言語・動作・視覚情報を離散系列化して自己回帰予測し、オープンソースで SOTA となる平均スコア 72.5 を記録した。
リリース: 2026-09-14 · 読了 5

論文概要

DeepCybo Team らの研究グループは、物理世界の理解、アクションの生成、そして将来の状態予測を統合的に行う新しい物理基盤モデル「PhysBrain 1.5」を発表した。本研究では、観測、インタラクション、環境変化という物理的ループ(physical loop)に着目し、汎用的な VLM(Vision-Language Model)をベースとして言語応答、エンドエフェクタ(ロボットアームの先端など)の動作、高密度な視覚ターゲットを離散系列(discrete sequences)にエンコードする。これらを自己回帰の次トークン予測(autoregressive next-token prediction)によって共同最適化する共通の学習フレームワークを構築している。

関連研究

従来のロボティクスや Embodied AI の分野では、個別のタスクや環境ごとに専用の制御ポリシーや視覚モデルが構築されることが多かった。これに対し、大規模な VLM やマルチモーダルモデルの知見をそのまま物理世界・動作生成へと拡張するアプローチが進められているが、言語・視覚・物理制御を単一の自己回帰ループでシームレスに結合するオープンソースモデルの統合的なベンチマーク性能には限界があった。本研究は、人間インタラクション動画を用いた大規模な事前学習と多様なデモデータのファインチューニングにより、このギャップを埋めるものである。

新規性と貢献

本研究の最大の新規性は、人間と環境のインタラクション動画から得られるタスク中心のエピソードを用いて、意味的・空間的コンテキストと動作・後続観測をペアリングし、 embodied な教師信号(embodied supervision)を完全にデータ駆動で抽出する点にある。8B パラメータ規模のモデルでありながら、28 の embodied 理解ベンチマークで平均スコア 72.5 を達成し、オープンソースモデルとして新しい SOTA を樹立した。さらに、プロプライエタリなモデルである GPT-6-Astra や Gemini 3.6 Flash に匹敵する性能を、汎用マルチモーダル機能を保持したまま実証している点も重要な貢献である。

提案手法の詳細

PhysBrain 1.5 は、人間インタラクション動画を用いた事前学習により、言語と空間コンテキストを動作の復元および後続の観測結果と結びつける。その後、人間によるデモ、ロボット軌跡、シミュレーション経験の混合データを用いた教師ありファインチューニング(SFT)を実施する。設計の直感として、ロボットの動作制御や将来予測を特別なモジュールとして切り離すのではなく、VLM の得意とする離散系列の自己回帰予測タスクの一部として同一の空間上で並行処理させることで、大規模言語モデルが持つ汎用的な推論能力と物理的制御能力のシナジーを引き出している。

評価・考察

28 の embodied 理解ベンチマークにおいて、8B モデルが平均スコア 72.5 を記録し、そのうち 14 のベンチマークでオープンソース最高成績(best open-source results)をマークした。定性的な評価においても、空間的にアライメントされた RGB 画像、デプス(深度)情報、ロボットマスクの出力を通じて、エンドエフェクタの軌跡生成や将来のシーン予測が可能であることを示しており、定量・定性の両面で高い信頼性を示している。

応用例と今後の展望

実務的な応用として、製造業におけるロボットアームの把持・組立制御や、物流倉庫での自律的なピッキング動作の事前学習・プランニングへの応用が挙げられる。日本の製造業・ロボット研究分野(例:FA機器メーカーや産業用ロボットのインテグレーションを手がける企業)においては、従来の閉じた制御システムに代わり、汎用マルチモーダル基盤モデルをベースとした柔軟な把持・環境適応システムの実装・検証を加速させるマイルストーンとなる。今後の課題としては、シミュレーションから実世界へのドメイン適応のさらなる効率化や、計算コストの最適化が想定される。

結論

PhysBrain 1.5 は、汎用視覚言語モデルの枠組みを拡張して物理環境の理解・動作生成・未来予測を統合する新しい物理基盤モデルである。28 のベンチマークで平均 72.5 点を記録しオープンソースの SOTA を更新したことは、今後の Embodied AI の標準的なアーキテクチャ設計に大きな影響を与えると考えられる。

注釈

  • VLM (Vision-Language Model): 画像とテキストの両方を理解・処理するマルチモーダル大規模言語モデル。
  • Embodied AI: 物理的な身体(ロボットや仮想アバターなど)を持ち、環境とインタラクションしながら学習・行動する AI 技術。
  • エンドエフェクタ (End-effector): ロボットアームの先端に装着され、作業対象を直接操作するツールやハンド部分。