ARC-AGI-3 Leaderboard 公開──AI エージェントの適応能力と推論効率を可視化
静的な知能評価から動的な環境適応へシフトし、推論コストと性能の相関を $10,000 以下の予算制限下で比較可能にした。
リリース: 2026-01-01 · 読了 3 分記事の要約
1. 核心(What)
- ARC-AGI-3 リーダーボードは、静的な知能測定から動的な対話環境への適応能力評価へ移行した。
- 推論コストと性能の相関を可視化し、効率性を重視した評価軸を導入した。
- 掲載対象は実行コスト $10,000 未満のシステムに限定されている。
- Kaggle 競技部門では、120 の評価タスクに対して $50 の計算予算制限を課している。
2. 影響(Why)
- 推論コスト対効果の明確化: 単なる正解率だけでなく、推論時間とコストの相関が可視化されたことで、実環境へのデプロイ時に「どの推論レベルが最適か」を定量的に判断できる。
- 国内 SaaS 事業者への影響: 自社でエージェント型 RAG を構築する国内の Vertical SaaS 事業者(中規模)は、ARC-AGI-3 のコスト効率指標を参考に、LLM の推論時間と精度トレードオフを再設計する必要がある。
3. 根拠・詳細(How)
- 評価手法と制約: Reasoning Systems は同一モデルの異なる推論レベルを接続点としてプロットし、思考時間増加に伴う性能の漸近的挙動を可視化している。
- 検証環境の仕様: Kaggle 競技部門では 120 タスクの評価に $50 の予算制限を設け、GPT-4.5 や Claude 3.7 などのベースモデルと、専用の推論強化システムを同一基準で比較している。
4. 展望・課題(Next)
- Gemini 3 Pro の再テスト: 現在暫定値となっている Gemini 3 Pro のスコアは、正式リリース後に再テストを実施し更新予定である。