Anthropic、Opus 5 のプロンプトインジェクション耐性を強化──System Card で実証
Anthropic のエンジニア Boris Cherny 氏が、最新モデル Opus 5 におけるプロンプトインジェクション耐性の向上を明言。
リリース: 2026-07-25 · 読了 3 分記事の要約
1. 核心(What)
- Anthropic の最新モデル Opus 5 が、同社史上最もプロンプトインジェクションに対して高い耐性を持つモデルとして公開された。
- System Card の 73 ページに記載された評価結果によると、PI(Prompt Injection)評価およびレッドチーミングにおいて、従来のモデルと比較して攻撃の成功率が大幅に抑制されている。
- Boris Cherny 氏が自身の見解として、ベンチマークスコア以上にこのセキュリティ上の堅牢性が最も重要な成果であると強調した。
2. 影響(Why)
- セキュリティの設計思想: ベンチマークスコアの微増よりも、モデルの制御不能な挙動を抑える「安全性」が実務上の優先順位として高まっていることを示している。
- 国内 SaaS への影響: 顧客データを直接 LLM に渡す [国内の金融・医療向け SaaS 事業者] 規模の組織は、Opus 5 のような耐性を持つモデルを採用することで、攻撃者によるプロンプト注入のリスクを低減できる。
3. 根拠・詳細(How)
- 評価手法の裏付け: System Card の 73 ページに記載された PI(Prompt Injection)評価およびレッドチーミングのログに基づき、攻撃成功率を算出。