🧠Research🔥🔥

Epoch AI、MirrorCode ベンチマークを更新──Claude Fable 5 が 64% の解決率で GPT-5.6 Sol を圧倒

ソースコードなしのコンパイル済みバイナリから CLI プログラムを完全再実装させる MirrorCode ベンチマークで、Claude Fable 5 が GPT-5.6 Sol の 20% を引き離す首位を獲得した。
リリース: 2026-08-03 · 読了 3

記事の要約

1. 核心(What)

  • Epoch AI は長期的ソフトウェア工学ベンチマーク MirrorCode を更新し、Claude Fable 5 と GPT-5.6 Sol の評価結果を公開した
  • Claude Fable 5 は解決率 64% を記録し、GPT-5.6 Sol の 20% や GPT-5.5 の 10% を大きく上回った
  • MirrorCode は AI にソースコード非公開のコンパイル済みバイナリを与え、仕様書と可視テストを基に CLI プログラム全体をゼロから再実装させる
  • 最難関タスクでは 1 回の実行に 19 日間を要し、コストが 2,600 ドルに達する大規模な推論予算が投じられた

2. 影響(Why)

  • 長期的エージェント評価の実用化: 数ドル規模の推論制限しかなかった既存ベンチマークとは異なり、数日間にわたる巨額の推論予算を許容する環境でモデルの限界を測るため、実運用に近い自律アーキテクチャの優劣を判断できる。
  • 難解タスクの自動解決: 従来モデルの弱点だった C プリプロセッサや Pkl タスクを Claude Fable 5 が初めて突破したため、複雑なメタプログラミングを伴う実務への適用ハードルが低下する。

3. 根拠・詳細(How)

  • ブラックボックス再実装の検証手法: AI エージェントにはソースコードやインターネットアクセスを一切与えず、実行専用バイナリ、テキスト仕様書、可視エンドポイントテストのみを提供し、隠しテストを含めて 100% の通過を要求する。
  • オープンソースによる公開データセット: 評価対象となる 25 個のターゲットプログラムのうち 22 個と完全なスカフォールドが GitHub で公開され、論文は arXiv で閲覧可能となっている。

4. 展望・課題(Next)

  • プログラミング言語横断の汎用性検証: Ada などのマイナー言語でも Go と同等の性能が確認されたことから、今後はより多様なドメイン固有言語での長期的自律検証へスコープが拡大する予定である。