🧠Research🔥🔥

DeepSeek V4 Pro 0813 と GPT-5.6 Sol の DeepSWE 比較評価モデル──35倍の価格差と最適なカスケードルーティング手法の検証

DeepSeek V4 Pro 0813を初段に置き失敗時のみGPT-5.6 Solへエスカレーションするカスケード構成により、単体Sol比で精度+10%・コスト60%削減を達成した。
リリース: 2026-08-18 · 読了 3

記事の要約

1. 核心(What)

  • Together AI社が公開したDeepSWEベンチマーク(113タスク、計904ロールアウト)において、GPT-5.6 Solは単一試行のpass@1で72.7%を記録し、DeepSeek V4 Pro 0813の62.8%を上回った。
  • ロールアウトコストはDeepSeek V4 Pro 0813が1回あたり$0.24、GPT-5.6 Solが$8.37であり、約35倍の価格差がある。
  • 4回試行のpass@4ではDeepSeek V4 Pro 0813が88.5%に達し、GPT-5.6 Solの85.8%を逆転する。
  • DeepSeek V4 Pro 0813を初段に置き、失敗時にGPT-5.6 Solへエスカレーションするカスケード構成では、解決率83.0%・1タスクあたり$3.35を達成した。

2. 影響(Why)

  • 高コストモデル単体運用からの脱却: 1回$8.37のフラッグシップモデルを全量投入する設計から、安価なモデルで大部分を処理し難所だけ高価格モデルに送る構成へ移行しないと、エージェント機能のAPI費用が破綻する。
  • 国内LLMエージェント基盤のコスト最適化: 国内の受託開発・SaaS事業者(従業員50〜300人規模のAI開発チームを想定)は、自動コーディングエージェントのバックエンドを単一モデル固定からマルチモデルのフォールバック構成に改めるべき実証データが得られた。

3. 根拠・詳細(How)

  • DeepSWEでの実行・評価仕様: 全113タスクに対し各モデル4試行(計904ロールアウト)を実施し、pass@1からpass@4までの推移、トークン数、出力ステップ数、既存テストスイートの破壊率を比較検証した。
  • カスケードルーティングの動作仕様: 安価なDeepSeek V4 Pro 0813の出力をリポジトリのテストスイートで検証し、不合格となった場合のみGPT-5.6 Solにエスカレーションして再実行する二段構えのパイプラインとして実装されている。

4. 展望・課題(Next)

  • マルチモデル混成エージェントの標準化: 今後は単一のSOTAモデルを呼び出すアーキテクチャから、コストと精度のトレードオフを自動制御するルーティング層を組み込んだマルチモデルエージェントフレームワークへの移行が進む。