Anthropic、Claude Opus 5 を発表──Fable 5 級の推論能力を半額で提供
Frontier-Bench 等で SOTA を更新しつつ、推論効率を大幅に改善した次世代モデル。
リリース: 2026-07-23 · 読了 5 分記事の要約
1. 核心(What)
- Claude Opus 5 を公開。Frontier-Bench および GDPval-AA で SOTA を達成。
- Opus 4.8 と同等のコストで、推論性能を大幅に向上。
- ARC-AGI 3 ベンチマークで次点モデルの 3 倍のスコアを記録。
- OSWorld 2.0 において、Fable 5 のベストスコアを 1/3 未満のコストで上回る。
2. 影響(Why)
- エージェント運用の実用化: 自己検証と反復能力が向上しており、複雑なコードベースの修正や、自前でテストハーネスを構築するような自律的なタスクにおいて、人間による監視コストを劇的に下げられる。
- 国内 SaaS への影響: 金融やヘルスケア領域の国内中堅 SaaS 事業者は、高精度な推論を低コストで実行できるため、これまで API コストが障壁だった複雑なドキュメント解析や自動化ワークフローを本番環境へ容易に組み込める。
3. 根拠・詳細(How)
- 推論効率の最適化: effort 設定によるトークン消費の制御を強化。金融モデリングタスクでは、Opus 4.8 比で精度を 9% 向上させつつ、ツール呼び出し回数を 1/3 に削減し、処理時間を 60% 短縮。
- 安全性とガードレール: Claude の憲法(Constitution)への準拠を強化し、デセプティブ(欺瞞的)な挙動を最小化。OSS-Fuzz を用いた検証では、脆弱性の発見能力は高い一方、エクスプロイト生成能力は Mythos 5 を大幅に下回るよう設計。
4. 展望・課題(Next)
- サイバーセキュリティ領域: 脆弱性発見能力は向上しているが、悪用を防ぐための安全策が継続的に適用される予定。