Google DeepMind、モデル群 Gemini Robotics 2 を公開──全身制御とマルチロボット協調を実現
足先から指先までの全身を単一モデルで制御し、数時間のデモ学習で新ハードウェアに適応するロボティクス基盤。
リリース: 2026-07-30 · 読了 3 分記事の要約
1. 核心(What)
- Gemini Robotics 2 はカメラ入力と自然言語から直接モーターコマンドを生成する全身制御 VLA モデル。
- Gemini Robotics ER 2 は映像解析や多段階タスクの計画、Google Search 呼び出しを行う高次のembodied reasoningモデル。
- Gemini Robotics On-Device 2 はネットワーク接続不要でローカル動作し、数時間で新規ロボットボディへ適応する効率的 VLA モデル。
- ER 2 は Gemini API や Google AI Studio でパブリック利用可能であり、VLA および On-Device モデルは早期アクセスパートナー向けに提供。
2. 影響(Why)
- 全身制御によるタスク拡張: 従来の卓上アーム制御から、歩行から把持までの全身運動を単一モデルで処理可能になり、実世界での複雑なワークフロー自動化のハードルが下がる。
- マルチロボット間での協調: ヒューマノイドとアームなど異なるロボットプラットフォーム間で共有セマンティック層を介したタスク分割が可能になり、現場のシステム構成が柔軟になる。
3. 根拠・詳細(How)
- 3 層のモデルスタック構成: 高次推論を担当する ER 2、物理動作を司る全身 VLA の Robotics 2、ローカル環境で軽量動作する On-Device 2 の 3 層構造でスタックを分離。
- 少数サンプルによる迅速な適応: On-Device 2 は 200 件未満のデモデータを用い、数時間の学習サイクルで未踏のロボットボディへの適応を実現する設計。
4. 展望・課題(Next)
- 動作速度と器用さの向上: 電球のネジ込み作業成功率が 36% と低く、より高度な物理的器用さと動作速度の最適化が今後の課題。