Nvidia、エージェント学習レシピに関する研究を発表──Claude Opus 5 で ARC-AGI-3 を満点に
モデル単体の性能ではなく、メモリ管理とスーパーバイザーを統合した専用ハーネスの設計が長期タスクの成否を決定づけることを実証した。
リリース: 2026-08-21 · 読了 3 分記事の要約
1. 核心(What)
- Nvidia は 2026 年 8 月 21 日、AI エージェントの性能はモデル単体ではなく周囲のソフトウェア環境(ハーネス)に強く依存するという研究結果を発表した。
- Claude Opus 5 にメモリ管理とスーパーバイザー機能を備えたカスタムハーネス(AVO)を適用したところ、2D ゲーム型ベンチマーク ARC-AGI-3 で 100% のスコアを記録した。
- ハーネス適用前の Claude Opus 5 単体スコアは 30% であり、専用ラッパーの有無で正答率が劇的に変化することが示された。
2. 影響(Why)
- モデル選定からラッパー設計への投資シフト: 高額な先端モデルをそのまま API 呼び出しする設計から、自社でメモリや supervisor 層を制御するカスタムハーネスへの投資へアーキテクチャの主軸を移すべき。
- 国内 SaaS の長期タスク実装における費用対効果の改善: [国内 カスタマーサポート AI 開発企業] などの現場では、モデルのバージョンアップを待つよりも、コンテキスト管理や再試行ループを持つハーネスを自前実装する方が精度向上への近道になる。
3. 根拠・詳細(How)
- スーパーバイザー層の導入による軌道修正メカニズム: メインで動作するエージェントに加え、デッドロックや誤った探索パスを検知して軌道修正を行う CEO 的な役割を持つスーパーバイザーコンポーネントを統合した。
- インタラクティブ推論ベンチマーク ARC-AGI-3 の採用: 事前指示のない 2D ゲーム環境において、モデルが試行錯誤を通じてルールを発見する長期ホライズン型のタスク設計で検証を行った。
4. 展望・課題(Next)
- オープンなエージェントスタックの普及: Nvidia が提唱する Nemo ブランドのオープンなツール群をベースに、開発者がハーネス層をブラックボックス化させずに制御する動きが加速する見通し。