OpenAI、GPT-6 Astra モデルを発表──Epoch の高難度数学ベンチマーク FrontierMath Tier 4 で 98% を記録
FrontierMath Tier 4 をわずか 14 か月で事実上飽和させ、研究レベルの数学的推論能力で他社を引き離した。
リリース: 2026-09-10 · 読了 4 分記事の要約
1. 核心(What)
- OpenAI の GPT-6 Astra が FrontierMath Tier 4 で 98% のスコアを記録し、最後まで残っていた未解決問題 1 件を解決した。
- Tier 4 のスコアは 2025 年 7 月の導入時点の 5% から 14 か月で飽和状態に到達した。
- ランナーアップとして GPT-5.6 Sol が 83.0%、GPT-5.6 Terra が 68.3% を記録している。
- 新たな難関評価セットである FrontierMath Erdős では、公式の評価ランで 68 問中 2 問の解決にとどまった。
2. 影響(Why)
- ベンチマークの飽和による評価指標の移行: 従来の Tier 4 単一答え合わせ型の数学ベンチマークが頭打ちになったため、今後は Lean などの形式システムによる完全な証明構築や未解決問題トラックへ評価の軸が移る。
- 国内金融・数理最適化 SaaS への示唆: 数理最適化やシミュレーションを内製する国内金融・製造系テック企業は、単純な最終解の精度ではなく長時間の推論トレースを伴うエージェント型処理への移行設計を急ぐ必要がある。
3. 根拠・詳細(How)
- モデルの総合的なアーキテクチャ統合: 数学特化モデルではなく、事前学習・強化学習・アライメントの長年の統合により、コンピュータ操作やブラウジング、サイバーセキュリティを含む幅広いタスクで SOTA を達成している。
- 評価手法と計算コストの制約: 最大推論エフォート設定で実行されたためレイテンシとトークン消費が増大しており、FrontierMath Erdős の追加検証では高額な計算コストが発生している。
4. 展望・課題(Next)
- FrontierMath Erdős への移行: Epoch AI は Lean で形式化された 68 問の Erdős 問題セットへ評価軸をシフトしており、モデルに完全な証明や反証の生成を求めている。