🧠Research🔥🔥

ARC-AGI-3 Leaderboard 公開──AI エージェントの適応能力と推論効率を可視化

静的な知能評価から動的な環境適応へシフトし、推論コストと性能の相関を $10,000 以下の予算制限下で比較可能にした。
リリース: 2026-01-01 · 読了 3

記事の要約

1. 核心(What)

  • ARC-AGI-3 リーダーボードは、静的な知能測定から動的な対話環境への適応能力評価へ移行した。
  • 推論コストと性能の相関を可視化し、効率性を重視した評価軸を導入した。
  • 掲載対象は実行コスト $10,000 未満のシステムに限定されている。
  • Kaggle 競技部門では、120 の評価タスクに対して $50 の計算予算制限を課している。

2. 影響(Why)

  • 推論コスト対効果の明確化: 単なる正解率だけでなく、推論時間とコストの相関が可視化されたことで、実環境へのデプロイ時に「どの推論レベルが最適か」を定量的に判断できる。
  • 国内 SaaS 事業者への影響: 自社でエージェント型 RAG を構築する国内の Vertical SaaS 事業者(中規模)は、ARC-AGI-3 のコスト効率指標を参考に、LLM の推論時間と精度トレードオフを再設計する必要がある。

3. 根拠・詳細(How)

  • 評価手法と制約: Reasoning Systems は同一モデルの異なる推論レベルを接続点としてプロットし、思考時間増加に伴う性能の漸近的挙動を可視化している。
  • 検証環境の仕様: Kaggle 競技部門では 120 タスクの評価に $50 の予算制限を設け、GPT-4.5 や Claude 3.7 などのベースモデルと、専用の推論強化システムを同一基準で比較している。

4. 展望・課題(Next)

  • Gemini 3 Pro の再テスト: 現在暫定値となっている Gemini 3 Pro のスコアは、正式リリース後に再テストを実施し更新予定である。