🧠Research🔥🔥🔥

Anthropic、Claude Opus 5 を発表──Fable 5 級の推論能力を半額で提供

Frontier-Bench 等で SOTA を更新しつつ、推論効率を大幅に改善した次世代モデル。
リリース: 2026-07-23 · 読了 5

記事の要約

1. 核心(What)

  • Claude Opus 5 を公開。Frontier-Bench および GDPval-AA で SOTA を達成。
  • Opus 4.8 と同等のコストで、推論性能を大幅に向上。
  • ARC-AGI 3 ベンチマークで次点モデルの 3 倍のスコアを記録。
  • OSWorld 2.0 において、Fable 5 のベストスコアを 1/3 未満のコストで上回る。

2. 影響(Why)

  • エージェント運用の実用化: 自己検証と反復能力が向上しており、複雑なコードベースの修正や、自前でテストハーネスを構築するような自律的なタスクにおいて、人間による監視コストを劇的に下げられる。
  • 国内 SaaS への影響: 金融やヘルスケア領域の国内中堅 SaaS 事業者は、高精度な推論を低コストで実行できるため、これまで API コストが障壁だった複雑なドキュメント解析や自動化ワークフローを本番環境へ容易に組み込める。

3. 根拠・詳細(How)

  • 推論効率の最適化: effort 設定によるトークン消費の制御を強化。金融モデリングタスクでは、Opus 4.8 比で精度を 9% 向上させつつ、ツール呼び出し回数を 1/3 に削減し、処理時間を 60% 短縮。
  • 安全性とガードレール: Claude の憲法(Constitution)への準拠を強化し、デセプティブ(欺瞞的)な挙動を最小化。OSS-Fuzz を用いた検証では、脆弱性の発見能力は高い一方、エクスプロイト生成能力は Mythos 5 を大幅に下回るよう設計。

4. 展望・課題(Next)

  • サイバーセキュリティ領域: 脆弱性発見能力は向上しているが、悪用を防ぐための安全策が継続的に適用される予定。