🧠Research🔥🔥🔥

OpenAI、ロボット制御モデル GPT-6 Astra を公開──YAM アームによるブロック把持タスクで成功率 95% を記録

Claude Fable 5.1 と同一の YAM アーム環境で比較検証を実施し、ボウル配置タスクで成功率 95%・実行コスト $0.94/run を達成した。
リリース: 2026-09-04 · 読了 3

記事の要約

1. 核心(What)

  • OpenAI の GPT-6 Astra を使い、Claude Fable 5 と同一の YAM アームおよび Inspect Robots エージェントポリシーによるロボットマニピュレーション比較検証を行った。
  • 「赤いブロックをボウルに置く」タスクにおいて、GPT-6 Astra は 20 トライ中 19 回成功し、Fable 5.1 の 8 回を大きく上回る結果を出した。
  • 「丸い青いパズルピースを溝にはめる」タスクでは、GPT-6 Astra と Claude Fable 5.1 ともに 20 トライ中 2 回の成功にとどまった。
  • ボウル配置タスクにおける 1 ランあたりのコストは GPT-6 Astra が $0.94、Fable 5.1 が $2.12 であった。

2. 影響(Why)

  • 推論コストの半減と実運用コスト: 1 ランあたりのコストが $2.12 から $0.94 へ低下するため、物理ロボットを用いた複数台同時の長時間ベンチマーク運用における予算制約を緩和できる。
  • 国内ロボット SIer への示唆: [国内 ロボット SIer 規模の組織] は、専用ハード側のロジックで作り込んでいた把持・配置の例外処理を VLM 側の推論で吸収するアーキテクチャの検討が可能になる。

3. 根拠・詳細(How)

  • 検証環境とタスク設計: YAM アームと Inspect Robots エージェントポリシーを共通採用し、ボウル配置およびパズル嵌め込みの 2 タスクで各 20 トライ(計 120 トライ)を検証した。
  • コストとパフォーマンスの測定: ヒューマンクレーダーによるステージ別スコアリングを行い、思考ポーズを除外した実経過時間とオープンリスト価格ベースでのコストを比較した。

4. 展望・課題(Next)

  • 検証環境の統一とバイアス排除: リグの物理的差異や、モデル名が既知の状態で行われたオペレーター評価における無意識のバイアスを排除した再検証が必要となる。