Anthropic、ブラウザ操作エージェント拡張機能 Claude in Chrome を正式公開──visual grounding 方式と 3 段階権限スコープを実装
DOM依存のない画面認識で任意のWeb操作を自動化しつつ、毎回オフから始まる権限スコープでプロンプトインジェクションの攻撃面を最小化する。
リリース: 2026-09-01 · 読了 4 分記事の要約
1. 核心(What)
- Anthropicは2026年8月26日、ブラウザ操作エージェント拡張機能「Claude in Chrome」を正式公開した。
- DOM要素に依存せず、画面の視覚的認識(visual grounding)によって操作対象の座標を推定する設計になっている。
- 「クリック時のみ」「特定サイトのみ」「すべてのサイト」の3段階の権限スコープを搭載し、初期状態は常にオフとなる。
- 実行前の操作を検証する安全性分類器を挟むことで、プロンプトインジェクションに対する多層防御を実現している。
2. 影響(Why)
- 保守コストの低減とトレードオフ: マークアップ変更に強い反面、動的レイアウトのページでは誤クリックの余地が残るため、定型バッチ処理ではなく非定型タスクに向く。
- 最小権限原則によるリスク統制: 毎回初期状態がオフになる仕様により、意図しないバックグラウンドでの操作実行を防ぎ、実務導入時のセキュリティリスクを抑える。
- 国内導入におけるガバナンス要件: [国内の業務システム開発企業] 等では、自動承認モードの境界が確率的である点を前提に、機密を扱うサイトでは権限を都度許可制にする運用設計が不可欠。
3. 根拠・詳細(How)
- visual grounding による座標推定: アクティブタブのスクリーンショットを Claude が解析し、視覚的な見た目からボタンやリンクの位置を割り出してクリックを実行する。
- capability-based security の権限管理: 3段階のスコープ設定により、ユーザーが明示的に許可した瞬間および対象にのみ実行権限を限定し、平常時の攻撃対象領域を最小化する。
- 独立した安全性分類器による多層防御: モデル本体の生成処理とは別のレイヤーで、ユーザー指示と実行予定の操作の整合性を検査するプローブを通過させる設計。
4. 展望・課題(Next)
- 自動承認モードの精度評価: 重要操作と判断される境界線が分類器依存であるため、実際の業務負荷テストを通じた振る舞いの検証が必要となる。