Artificial Analysis、エンタープライズ向け評価ベンチマーク Cyber Index を公開──上位 AI モデル間で 65 倍のコスト格差と安全性の制限を暴露
セキュリティタスクの網羅性、コスト、安全性の拒否率を定量化し、同一スコアでも 65 倍の価格差や過剰なガードレールによる 3 割のタスク拒否が実務選定を左右することを明かした。
リリース: 2026-09-28 · 読了 4 分記事の要約
1. 核心(What)
- Artificial Analysis は企業向けサイバー防御の評価リーダーボード「Cyber Index」を公開し、脆弱性の発見・検証・パッチ適用能力を測定した。
- 評価対象モデルの間で同一スコアでありながら最大 65 倍のタスクコスト格差(MiMo-V2.6-Pro の $0.18 に対し Grok の高価格帯設定など)が存在することが判明した。
- GPT-6 Sol や Claude Opus 5.5 などの主要モデルは安全保障ポリシーにより全タスクの 32%〜38% を拒否しスコアを下げている。
- 評価は CWE-Bench-AA、DeepsecBench-AA、CyberGym-E2E-AA の 3 つの等価重み付けベンチマークを使用している。
2. 影響(Why)
- ガードレールが実運用を制限: 強力なモデルほど安全ポリシーによる拒否率が高いため、実務上の自動化範囲を見極めるにはスコアだけでなく拒否率の分離評価が必須となる。
- コスト効率の大きな乖離: 同等の性能を持つモデル間で 65 倍の価格差があるため、社内セキュリティエージェントの運用において予算予測の前提が根本から変わる。
3. 根拠・詳細(How)
- Stirrup エージェントハーネスの採用: オープンソースの Stirrup エージェントハーネスを用い、C/C++、Go、Java、Rust など 6 言語の OWASP Top 10 タスクで統一的に監査・パッチ適用を検証した。
- 3 つのベンチマークの統合: CWE-Bench-AA(120 タスク)、DeepsecBench-AA(F2 スコアベース)、CyberGym-E2E-AA(FFmpeg や CPython 等の実メモリ安全バグ 131 タスク)を均等に重み付けして算出している。
4. 展望・課題(Next)
- インシデント対応への拡張計画: 今後はソースコード非公開のターゲットやインシデント対応、セキュアコード生成へとベンチマークの適用範囲を順次拡大する予定である。