OpenAI、未解決数学問題 10 件の証明モデルを発表──GPT-5.6 Sol 級の推論で 1 問あたり 2,000 ドル未満に抑制
Anthropic に続き OpenAI も高難度な数学的証明に成功し、Lean 4 の形式検証コードを公開したことで、数学界における AI の実用性が検証フェーズへ移行した。
リリース: 2026-08-01 · 読了 3 分記事の要約
1. 核心(What)
- OpenAI は過去 10 年間進展のなかった 10 件の未解決数学的問題の証明に成功したと発表した。
- 適用されたモデルは内部版 Astra の評価版であり、1 問あたりのトークン費用は GPT-5.6 Sol 価格で 2,000 ドル未満に収まった。
- openai/ten-proofs リポジトリにて Lean 4 による形式検証コードおよび解説ペーパーが公開されている。
- モデルが非公開の推論トレースから構築過程を再構築した LLM 生成の PDF も併せて配布された。
2. 影響(Why)
- 形式検証コードの一般公開: 単なる文章生成の域を脱し、Lean 4 による形式的証明がコードとして提供されたことで、生成結果の真偽をコンパイラで確実に判定できる実用的な開発基盤が整った。
- 国内リサーチ組織への影響: 国内の自動定理証明やコード検証を扱う研究機関(国立大学や大手企業の基礎研究部門など)は、既存の手動検証プロセスを置き換える形で AI の出力する Lean 4 コードのパイプライン統合を急ぐ必要がある。
3. 根拠・詳細(How)
- Lean 4 による形式検証: 出力されたすべての証明は証明支援系 Lean 4 の文法に準拠して形式化され、人間が手動でコードを検証せずとも機械的に正当性が担保される仕組みを採用している。
- 推論コストの抑制設計: GPT-5.6 Sol 級のトークン単価をベースに、1 問あたりの演算量を 2,000 ドル未満のコストキャップ内に収めることで、大規模探索を複数問題で並行実行する効率的な学習・推論レシピを適用した。
4. 展望・課題(Next)
- プロンプトのブラックボックス化: 具体的なプロンプトや、解決に至る過程で失敗した問題数(コストが発生したが解けなかったケース)のデータは未公開であり、今後の追加開示が待たれる。