📜Papers🔥🔥

GUI 操作エージェントの安全性とタスク遂行力を同時最適化するフレームワーク SCOPE の提案

Qwen3.5-9Bをベースに能力と安全性の双方を向上させ、OSWorldでタスク成功率54.17%、OS-BLINDで攻撃回避率64.30%を記録した。
リリース: 2026-08-27 · 読了 5

論文概要

グラフィカルユーザーインターフェース(GUI)を通じて複雑なタスクを遂行する Computer-use agents (CUAs) において、タスクの成功のみを目的とした従来の事後学習(Post-training)では、信頼性の高い安全行動が誘発されないという課題が存在する。本論文では、タスク実行能力と安全性に基づく意思決定を同時に最適化するフレームワーク「Safety and Capability Optimization for Policy Execution (SCOPE)」を提案する。

Figure 1: 従来手法と提案手法(Joint Capability-Safety Training)の動作比較の例。

関連研究

これまでの CUA の研究は主にタスク成功率の最大化に主眼が置かれており、実行中の環境リスクの評価や悪意ある指示に対する拒否行動についての統合的なアプローチは十分に探求されていなかった。本研究は、能力向上と安全性確保のトレードオフを克服するため、両者を統合した学習手法を提供する点で先行研究と異なる。

新規性と貢献

本研究の主要な貢献は、検証可能な能力タスクを環境リスクのバリアントに自動変換する自動合成パイプライン「SCOPE-Gen」の導入、および 3 種類の軌跡データからなる「SATraj-OS」データセットの構築にある。これにより、教師あり微調整(SFT)とオンライン強化学習を組み合わせた統合的な最適化を実現した。

Figure 2: 提案する自動タスク合成パイプライン「SCOPE-Gen」の全体概要。

提案手法の詳細

SCOPE は、通常タスクの遂行、環境リスク回避、および有害な目標に対する明確な拒否という 3 つの軌跡タイプを網羅的に学習する。まずこれらすべての軌跡タイプを用いて教師あり微調整(SFT)を行い、その後オンライン強化学習を通じてタスク遂行能力をさらに向上させる設計となっている。なぜなら、単一の目的関数ではリスク条件付きのポリシー制御が不十分になるためである。

評価・考察

Qwen3.5-9Bをベースモデルとして適用した SCOPE-RL は、OSWorld ベンチマークにおいて 54.17% のタスク成功率を達成し、OS-BLIND において 64.30% の攻撃回避率を記録した。これにより、評価されたエージェントの中で最高となる 58.80% の総合能力・安全性スコアを達成している。

Figure 3: OSWorldとOS-BLINDにおける各種モデルの能力と安全性のトレードオフ結果。

アブレーション分析により、拒否軌跡は攻撃回避率の向上に大部分寄与する一方、リスク処理軌跡は同等の攻撃回避レベルにおいてタスクの有用性をより高く維持することが示されている。

応用例と今後の展望

本手法は、企業のバックオフィス自動化やカスタマーサポートにおけるデスクトップ操作エージェントの安全性を担保するために直接応用可能である。国内の金融・医療分野などの厳格なセキュリティ要件が求められる領域において、誤操作や不正誘導を防ぐための基盤技術として、数千規模の操作ログを扱う実運用環境での検証が今後の課題となる。

結論

本研究は、CUA におけるタスク遂行能力と安全性を両立させるためのフレームワーク SCOPE および自動データ合成パイプライン SCOPE-Gen を提案し、実用的な運用に向けた大きな性能向上を実証した。

注釈

  • Computer-use agents (CUAs): GUI 画面を視認・操作して人間のようにコンピュータタスクを自動実行する AI エージェントの総称。