🧠Research🔥🔥

Artificial Analysis、AI ベンチマーク Intelligence Index v4.2 を公開──非公開テストセットを 40% に倍増しハルシネーションとデータ汚染を防止

GPQA Diamond を廃止し、長期文書推論 GDP.pdf やエージェント評価 AA-Briefcase を導入することで、フロンティアモデルのカンニングと形骸化を防ぐ設計へ刷新された。
リリース: 2026-09-04 · 読了 3

記事の要約

1. 核心(What)

  • Artificial Analysis は Intelligence Index v4.2 を公開し、次期 v5 に向けた中間アップデートとして非公開評価セットの比率を全体の 40% に引き上げた。
  • モデルが事前学習で最適化(ゲーミング)しやすくなった GPQA Diamond ベンチマークを廃止し、長文脈文書推論の GDP.pdf とエージェント知識業務の AA-Briefcase を追加した。
  • GDP.pdf では 4,592 ページの PDF と 1,275 の基準を基に評価が行われ、GPT-6 Astra が 33.2%、GPT-5.6 Sol が 28.2%、Claude Fable 5.1 が 26.2% を記録した。
  • AA-Briefcase ではサンドボックス環境での数週間に及ぶ業務プロジェクトを通じ、Claude Opus 4.8 や GPT-5.5、Gemini 3.1 Pro Preview のローテーション審査で評価を実施している。

2. 影響(Why)

  • 公開ベンチマークの飽和対策: 従来の多肢選択式ベンチマークでは上位モデルの差別化が困難になったため、長期間の複雑なタスクや非公開データに依存しないと高得点が取れない設計への移行が急務となる。
  • 国内エンタープライズのモデル選定基準: [金融・保険 SaaS などの法務文書処理を扱う開発チーム] は、公開ベンチマークのスコア単体ではなく、実務の PDF 読解や複数週にわたるエージェント処理能力(GDP.pdf / AA-Briefcase)を調達時の主評価軸に置き換える必要がある。

3. 根拠・詳細(How)

  • GDP.pdf による長文脈ドキュメント検証: Surge AI が開発した 4,592 ページの PDF データセットを使用し、100 タスク・1,275 の厳格なルーブリック基準を満たした項目のみを全合格率(All-pass Rate)として算出する。
  • AA-Briefcase の多重アプローチ審査: インターネット接続なしの 500 ターン制限付きサンドボックス Linux 環境でエージェントを動かし、同一ファミリによるバイアスを防ぐため複数の最上位 LLM がペアワイズ Elo 比較で評価を下す。

4. 展望・課題(Next)

  • Intelligence Index v5 への移行: 非公開テストセットの比率をさらに引き上げる予定であり、フロンティアモデルの評価軸は静的な正答率から動的なエージェント環境へ移行が加速する。