Import AI 469: 70ゲームの探索的発見力を測る DiG-bench と科学的再現エージェント Faraday が登場
ゲームの隠れたルール探索でモデルの創造的直感を測る DiG-bench と、欠損データを自律補完する 27B の科学エージェント Faraday が公開された。
リリース: 2026-08-17 · 読了 4 分記事の要約
1. 核心(What)
- DiG-bench は、探索と好奇心を通じて環境の暗黙のルールを推論する能力を測定する 70 個のゲームから成るベンチマークである。
- 参加する作者は Thinking About Thinking、オックスフォード大学、プリンストン大学、KAUST、スイス AI 研究所、Inria、MIT などから構成される。
- Inherent が開発した Faraday は、プロプライエタリなフロンティアモデルを小規模 LLM で統括し、科学実験の欠損データを自律的に埋めるシステムである。
- Replica データセットは 1990〜2026 年の ML・科学 AI 論文 100 本を基にした 310 個の検証タスクで構成されている。
2. 影響(Why)
- 自律的発見能力の定量化: 未知の環境から未記載のルールを見つけ出す能力は、AI が創造性の前提を獲得する指標であり、2027 年半ばの人間パリティ到達に向けた進捗を正確に測る物差しになる。
- 国内 RAG・エージェント開発への示唆: [国内 AI 研究・検証組織] 規模のチームは、最先端モデルのベンチマーク評価において単なる対話応答だけでなく環境探索やタスク分解の性能を独自の検証パイプラインに組み込む必要がある。
3. 根拠・詳細(How)
- DiG-bench の構造と評価難易度: 7 段階の難易度 Tier のうち 21 ゲームが公開され、プレイヤーの各ステップでの選択肢数は 2 から最大 34 まで変化する。Tier 7 では人間が全勝する一方で、フロンティアモデルの正解率は 20%にとどまる。
- Faraday の学習機構と GRPO: Claude Opus 4.7 のメタルブリック生成による評価基準を用い、Codex ベースの Judge モデルから得られる報酬と per-turn クレジットを基に、GRPO の改良版で Faraday を継続トレーニングする。
4. 展望・課題(Next)
- 今後のベンチマーク拡張: 残る非公開ゲームの解放や、人間パリティへの接近に伴う再帰的自己改善(Recursive Self-Improvement)の検証が進められる予定である。