🧠Research🔥🔥

Zed、コーディングエージェント Delta のベンチマーク結果を公開──Codex と Claude Code に匹敵する精度を達成

Terminal-Bench 2.1 を用いた 4 つのフロンティアモデルの比較で、Delta はコストとタスク完了率でネイティブハーネスと同等以上の性能を示した。
リリース: 2026-09-25 · 読了 3 分

記事の要約

1. 核心(What)

  • Zed は協調型コーディングエージェント Delta のベンチマーク結果を 2026 年 9 月 25 日に公開した。
  • Terminal-Bench 2.1 を用いた検証において、Delta は OpenAI の GPT-5.6 Sol や Anthropic の Claude Opus 5 など 4 つのフロンティアモデルで Codex および Claude Code と同等以上のタスク通過率を記録した。
  • 成功タスクあたりのコストはネイティブハーネスの 0.80倍から 1.12倍の範囲に収まり、Kimi K3 モデルを用いた FrontierHarness の 30 タスクスイートでも高い通過率を維持した。
  • Anthropic モデルにおける Delta のツール呼び出し失敗率は約 1.5% と測定された。

2. 影響(Why)

  • ベンチマークスコア以外の評価軸の必要性: タスク通過率だけではリポジトリのコード品質やリトライ回数が隠れるため、実務でコードを維持する開発チームは失敗率やリクエスト数を含めたハーネス選定が不可欠になる。
  • 国内開発組織への影響と選定コストの圧縮: 国内の受託開発・SaaS 企業(中規模のプロダクト開発チームを想定)は、モデルベンダーのネイティブツールに縛られず、コストと信頼性を最適化した外部ハーネスを検証するインセンティブが生じる。

3. 根拠・詳細(How)

  • DeltaDB によるバージョン管理とコンテキスト保持: DeltaDB がファイルバージョンやエージェントのアクション履歴を記録し、競合するパッチの適用や他メンバーによる変更に伴う古いコンテンツの検知を制御する。
  • ターミナルツールと非同期操作の最適化: コマンドの完了を待つターミナルツールと独立した操作の並行実行に対応したハーネス設計により、同一タスクでモデルリクエスト数を削減する構成をとる。

4. 展望・課題(Next)

  • Terminal-Bench を超える共同編集ループの検証: Zed は、同時編集や古いファイル状態をテストする協調編集ループに焦点を当てた次の評価結果を順次公開する予定である。