🧠Research🔥🔥

Vals AI、Vals Index v2.1 を公開──Terminal-Bench 4 と税務タスク部門を追加してモデル比較を刷新

Terminal-Bench 4 と Tax Agent Bench を組み込み、Claude Opus 5.5 が 69.69% で総合首位を獲得した。
リリース: 2026-09-29 · 読了 3 分

記事の要約

1. 核心(What)

  • Vals Index v2.1 はコーディング評価を Terminal-Bench 2.1 から Terminal-Bench 4 へ移行し、新たに Tax Agent Bench 部門を追加した。
  • Claude Opus 5.5 が総合スコア 69.69% で首位となり、Claude Sonnet 5.5 が 69.22% で続いた。
  • Terminal-Bench 4 は 66 の新規タスクを収録し、ミニ・エージェント・ハーネスと 8 時間のタスク制限時間を採用している。
  • Sonnet 5.5 のテストコストは 1 回あたり 20.80 ドルで、Opus 5.5 の 32.77 ドルより約 37% 安価である。

2. 影響(Why)

  • 実務特化型の評価軸への移行: 一般的な汎用ベンチマークと異なり、シェル操作や税務処理などの実務エージェント性能を測れるため、社内業務自動化に向けたモデル選定の精度が高まる。
  • 国内 SaaS 事業者のコスト対効果の判断基準: 国内の AI アプリ開発チーム(BtoB SaaS 規模)は、最高精度を誇る Claude Opus 5.5 と約 42 倍安価な GPT-5.6 Luna との間で、予算に応じたトレードオフの定量的な判断が可能になる。

3. 根拠・詳細(How)

  • Terminal-Bench 4 の検証環境とスコアリング: mini-swe-agent ハーネスを使用し、Daytona の独立したサンドボックス内で bash ツールを介して実行。avg@3 pass@1 方式を採用し、全タスクで完全な検証通過が必須となる。
  • GDP 重み付けによる合成スコアの算出: 金融、コーディング、法律、税務の各部門スコアに対し、米国 GDP の推定シェアに基づく重み付けを適用して総合順位を算出している。

4. 展望・課題(Next)

  • 運用制約下での追加検証の必要性: 8 時間の長時間実行を前提としたスコアであるため、本番環境のレイテンシや予算制限に合わせた個別ベンチマークの再検証が引き続き求められる。