NVIDIA、 Nemotron モデルで国際情報オリンピック首位──人間の最高得点を更新
Nvidia の Nemotron-3-Ultra-CC が IOI 2026 で 535.4 点を獲得し、人間最高得点を上回るスコアを公式監視下で記録した。
リリース: 2026-09-05 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA の Nemotron-3-Ultra-CC が国際情報オリンピック (IOI 2026) で 535.4 点を獲得し、最高位の人間記録(498.27 点)を超過した。
- 検証はウズベキスタン現地で公式監督下、ネットワーク非接続・同一制限時間という公式コンテスト環境と完全に並行して実施された。
- 学習パイプラインでは 22,000 問のアルゴリズム問題と DeepSeek-V4-Flash による 120 万件の推論トレースが活用された。
2. 影響(Why)
- 推論コストの配分最適化: 550B 規模の巨大モデルを常に回すのではなく、30B 級の MoE モデルと推論時 GenCorrect ループを組み合わせることで同等以上の性能を引き出せるため、高コストな学習依存から推論時スケーリングへの舵を切る判断材料になる。
- 国内競技プログラミング組織への示唆: 国内の競技プログラミングコミュニティや AI 開発ベンチャー(数名〜数十名規模)は、単一の静的モデル性能評価から、テストケース検証ループ(GenCorrect 型の評価機構)を内製パイプラインへ組み込む設計へ移行する契機になる。
3. 根拠・詳細(How)
- 2 系統のモデル構造と学習レシピ: 30B-A3B(Mixture-of-Experts でアクティブ 3B)の Nano-CC は SFT と RL を併用し、550B-A55B の Ultra-CC は強化学習をスキップし SFT のみで構築。
- GenCorrect による推論時ループ: 候補解の並行生成、失敗テストケースの抽出、フィードバックによるコード修正を制限時間内まで反復する生成・評価・修正ループを実装。
4. 展望・課題(Next)
- 非構造化タスクへの適用限界: コンテストのような自動ジャッジ環境が存在しない曖昧な要件定義や遅延フィードバック環境では本手法の適用が困難であり、今後の評価機構の拡張が課題となる。