Google DeepMind、Gemini Robotics ER 2 を公開──動画理解とマルチロボット協調を強化
連続動画フィードのリアルタイム解析により進捗追跡とツールオーケストレーションを高速化し、ロボットの高度な自律制御を実現した。
リリース: 2026-07-30 · 読了 4 分記事の要約
1. 核心(What)
- Google DeepMind は 2026 年 7 月 30 日、ロボット向け高位脳モデルの最新版「Gemini Robotics ER 2」を発表した。
- 進捗分類タスクにおいて 57.4% の精度を達成し、前世代モデルや競合のフロンティアモデルを上回った。
- モーメント発見(正確なフレーム特定)では 91.3% の精度と 0.96 秒の平均絶対誤差を記録した。
- Gemini API、Google AI Studio、および Gemini Enterprise Agent Platform のプライベートプレビューを通じて提供を開始した。
2. 影響(Why)
- ロボット制御のレイテンシ最適化: 双方向ストリーミングエンドポイントにより、ストップ&シンクの遅延なしでマルチステップタスクを命令できるため、実時間制御の実装が現実的になる。
- 国内ロボティクス開発への波及: 国内の物流自動化やFA機器メーカーなどのロボットインテグレーション事業者は、自前の高位推論ロジック構築にかかる開発コストを大幅に削減できる。
3. 根拠・詳細(How)
- 進捗分類とモーメント発見の機構: 動画フィードを 5 段階の進捗レベルに量子化してリアルタイムの状況認識を実現し、91.3% の精度で特定のイベント発生フレームを特定する。
- マルチロボット協調と安全制御: 異なる種類のロボット間で共通のセマンティック理解を通じてタスクを引継ぎ、安全指示追従ベンチマークに基づき人間接近時に自律停止する。
4. 展望・課題(Next)
- さらなる複雑なタスクへの適応: 今後はより複雑な環境における物理エージェントの自律性を高め、ロボットコミュニティ向けの開発支援を拡大する予定。