OpenAI、ロボット制御モデル GPT-6 Astra を公開──YAM アームによるブロック把持タスクで成功率 95% を記録
Claude Fable 5.1 と同一の YAM アーム環境で比較検証を実施し、ボウル配置タスクで成功率 95%・実行コスト $0.94/run を達成した。
リリース: 2026-09-04 · 読了 3 分記事の要約
1. 核心(What)
- OpenAI の GPT-6 Astra を使い、Claude Fable 5 と同一の YAM アームおよび Inspect Robots エージェントポリシーによるロボットマニピュレーション比較検証を行った。
- 「赤いブロックをボウルに置く」タスクにおいて、GPT-6 Astra は 20 トライ中 19 回成功し、Fable 5.1 の 8 回を大きく上回る結果を出した。
- 「丸い青いパズルピースを溝にはめる」タスクでは、GPT-6 Astra と Claude Fable 5.1 ともに 20 トライ中 2 回の成功にとどまった。
- ボウル配置タスクにおける 1 ランあたりのコストは GPT-6 Astra が $0.94、Fable 5.1 が $2.12 であった。
2. 影響(Why)
- 推論コストの半減と実運用コスト: 1 ランあたりのコストが $2.12 から $0.94 へ低下するため、物理ロボットを用いた複数台同時の長時間ベンチマーク運用における予算制約を緩和できる。
- 国内ロボット SIer への示唆: [国内 ロボット SIer 規模の組織] は、専用ハード側のロジックで作り込んでいた把持・配置の例外処理を VLM 側の推論で吸収するアーキテクチャの検討が可能になる。
3. 根拠・詳細(How)
- 検証環境とタスク設計: YAM アームと Inspect Robots エージェントポリシーを共通採用し、ボウル配置およびパズル嵌め込みの 2 タスクで各 20 トライ(計 120 トライ)を検証した。
- コストとパフォーマンスの測定: ヒューマンクレーダーによるステージ別スコアリングを行い、思考ポーズを除外した実経過時間とオープンリスト価格ベースでのコストを比較した。
4. 展望・課題(Next)
- 検証環境の統一とバイアス排除: リグの物理的差異や、モデル名が既知の状態で行われたオペレーター評価における無意識のバイアスを排除した再検証が必要となる。