🧠Research🔥🔥

Cognition、コーディングエージェント Devin の最適化アップデートを公開──レビュー費用を最大 70% 削減

モデルルーティング・ツール一括実行・プロンプトキャッシュを統合し、Devin Fusion モードで FrontierCode 1.1 68.8 点を記録しつつ運用コストを大幅に圧縮した。
リリース: 2026-09-28 · 読了 3 分

記事の要約

1. 核心(What)

  • Cognition は Devin のコストを Fusion/Normal モードで 30-40%、Ultra モードで 15-20%、Devin Review で最大 70% 削減したと発表した。
  • Devin Fusion は FrontierCode 1.1 Extended で 68.8 点を記録し、タスクあたり平均コストは $0.60 と報告された。
  • モデルインディペンデンス機構により、Opus 5.5、GPT-6 Sol、Astra、Luna、および Kimi K3 ベースの SWE-2 をサブタスクごとに動的ルーティングする。
  • プロンプトキャッシュの最適化とシェルコマンドの並列・一括実行により、5 ターン例でのゼロからの処理トークン数を約 71% 削減した。

2. 影響(Why)

  • エージェント運用コストの劇的な引き下げ: 長時間のコーディング・テスト・デバッグセッションで蓄積する推論コストが最大 70% 落ちるなら、社内タスクへのエージェント常時投入の ROI が実用ラインに乗る。
  • 国内受託開発およびSaaS事業への影響: [国内受託開発・SaaS企業] のような開発現場では、AI コーディングアシスタントの月額運用費が半減するため、複数エージェントを並行走らせる体制への移行を前倒しする判断材料になる。

3. 根拠・詳細(How)

  • モデルルーティングと専用モデル SWE-2: タスクの難易度に応じて Opus 5.5 や GPT-6 系列を使い分け、Moonshot AI の Kimi K3 をベースに強化学習した専用モデル SWE-2 を Devin 内部限定で統合してコストを最適化した。
  • ツール呼び出しのバッチ化と並列実行: コード整形・Linter 実行・テストを単一のツール呼び出しにまとめ、相互依存のないコマンドを並列実行することで、4 ターンかかっていた対話を 2 ターンへ短縮した。
  • プロンプトキャッシュのプレフィックス安定化: システム指示やリポジトリコンテキストなど変更のないプレフィックスを維持するプロンプト設計を採用し、5 ターン例でキャッシュ対象外の処理トークン数を 93,000 から 27,000 へ削減した。

4. 展望・課題(Next)

  • ベンダー非依存での検証の必要性: 公開されたベンチマーク結果は Cognition の社内テストによる未監査データであり、自社リポジトリでの実測による検証が不可欠となる。