GPT-6 Astra ロボットエージェント PyRUA-Lean──トークン量を 65% 削減しつつ成功率 14% 向上
フィードバック駆動型のプリミティブ構成と選択的観察により、LIBERO-PROなどのベンチマークでトークン消費量を65%削減しつつ成功率を71.7%に高めた。
リリース: 2026-10-01 · 読了 5 分論文概要
ビジョン言語モデル(VLM)を用いたロボットエージェントにおいて、頻繁なモデル呼び出しと冗長な視覚観測が多大なトークンオーバーヘッドを引き起こしているという課題に対し、本論文ではインタラクティブなコード実行フレームワーク「PyRUA-Lean」を提案する。LIBERO-PRO、RoboTwin 2.0、RoboCasa365を用いた700のシミュレーションタスクインスタンスによる評価において、同等のLLM呼び出し予算の下で、全体的な成功率を従来の63.1%から71.7%に向上させつつ、入力トークン量を65%削減することに成功した。

関連研究
従来のVLMベースのロボット制御では、各ステップごとに画像と状態を入力としてモデルを繰り返し呼び出すツールコールアプローチが主流であった。しかし、この手法は不要な情報まで毎回モデルに送信するため、トークン消費量が膨大になり、コンテキスト長やコストの面でスケーラビリティに限界があった。本研究は、条件分岐やリトライをコードブロック内で完結させることで、不要なAPI呼び出しと冗長なデータ入力を削減するアプローチをとる。
新規性と貢献
本研究の最大の新規性は、フィードバック駆動型のプリミティブ構成と「選択的観察(selective observation)」を組み合わせた点にある。従来の手法とは異なり、エージェントが明示的に要求した画像と状態フィードバックのみを再プランニング用に返す設計により、APIコストの大幅な削減と制御精度の両立を実現した。
提案手法の詳細
PyRUA-Leanは、古典的なロボットプリミティブと学習済みのVision-Language-Action(VLA)ポリシーをPythonセルとして組み合わせるフレームワークである。エージェントは条件分岐チェックやローカルでのリトライを含むコードを生成し、実行結果のうち必要なフィードバックのみを受け取る。

この設計により、毎ステップの冗長な画像入力を排除し、タスクの進行に必要な最小限の対話回数でロボットを制御することが可能となる。
評価・考察
LIBERO-PRO、RoboTwin 2.0、RoboCasa365を網羅する合計700のシミュレーションタスクインスタンスにおいて、同じGPT-6 Astraプランナーを用いた従来のツールコールベースラインと比較検証が行われた。結果として、同等のLLM呼び出し予算で成功率が63.1%から71.7%へと向上した。また、両エージェントが解決したインスタンスにおいて、LLM呼び出し回数を49%削減し、入力トークン量を65%削減するという高い効率性を実証した。

応用例と今後の展望
実世界ロボットの遠隔操作および自動化システムにおけるAPIコスト削減と推論レイテンシ低下に直結する。特に、多関節アームを用いた製造業の組み立てラインや、商用サービスロボット分野(規模感として数千台規模の稼働を想定するシステム)において、クラウド側のLLM推論コストを劇的に下げる実務インパクトを持つ。今後は、より複雑な動的環境下でのロバスト性の検証や、リアルタイム性が求められるエッジデバイスへの最適化が課題となる。
結論
PyRUA-Leanは、VLMベースのロボットエージェントにおけるトークン冗長性の問題に対し、コード実行と選択的観察に基づく明確な解決策を提示した。精度を犠牲にすることなくトークン量を65%削減できる点は、今後の自律ロボット開発における標準的な設計パターンとなる。
注釈
- Vision-Language-Action (VLA) モデル: 視覚・言語の理解とロボットの動作出力を統合したAIモデル。
- プリミティブ: ロボット制御における基本的かつ再利用可能な動作単位(把持、移動など)。