🧠Research🔥🔥

Datacurve、推論ベンチマーク DeepSWE v1.1 を公開──Claude Opus 5 が 74% で首位を獲得

Datacurve の汚染フリーな長期コーディングベンチマーク DeepSWE v1.1 において Claude Opus 5 が 74% を記録し首位を獲得した一方、GPT-5.6 Sol はわずか 61 ステップで完遂しステップ効率で優位性を示した。
リリース: 2026-07-28 · 読了 3

記事の要約

1. 核心(What)

  • Datacurve は汚染フリーな長期コーディングベンチマーク DeepSWE v1.1 を公開し、18 のフロンティアモデルを評価した。
  • Claude Opus 5 は 74.0% を記録し、同ベンチマークのリーダーボードで首位を獲得した。
  • GPT-5.6 Sol は 72.7% で 2 位となり、平均 61 ステップという高効率な実行性能を示した。
  • Claude Opus 5 は Fable 5 と比較してタスクコストが $11.84 と 45% 低下し、ツールコールの解説を 11% に抑えて動作する。

2. 影響(Why)

  • 実コード修正におけるコスト効率の転換点: 長期コーディングタスクにおいて Claude Opus 5 が Fable 5 比で 45% のコスト削減を達成したことで、複雑なリポジトリ修正エージェントの運用単価が現実的な水準に落ちる。
  • 国内受託開発およびSaaSのモデル選定への影響: 大規模なコードベースの自動改修を組み込む国内のレガシーシステム保守ベンダーは、ステップ効率の GPT-5.6 Sol とコスト優位の Claude Opus 5 をタスク複雑性に応じて使い分ける設計に移行する価値がある。

3. 根拠・詳細(How)

  • 汚染フリータスクと厳格な検証環境の設計: 既存のコミット履歴から流用せずゼロから作成した 113 タスク(5 言語・91 リポジトリ)を用い、隔離環境でコミット済みコードを評価することで誤検知率 0.3%、偽陰性率 1.1% を達成した。
  • エージェントの挙動とステップ効率の差: Fable 5 がツールコールの 65% で実況ナレーションを行うのに対し、Opus 5 は 11% に抑えて静かに実行する。一方 GPT-5.6 Sol は平均 61 ステップで完遂し、最少ステップでの解決力を示した。

4. 展望・課題(Next)

  • 並列処理要件における弱点の克服: Claude モデル群は同期と非同期の分岐といった並列要件の取りこぼしが多いというドキュメント上の弱点があり、今後のバージョンでの改善が求められる。