🧠Research🔥🔥

Anthropic、自律型 AI アライメント手法探索システム AAR を公開──Claude Opus 4.8 が専門家を超えるコスト削減と性能を実証

Claude Opus 4.8 を中核とした AAR システムにより、10 種類のアライメント失敗を人間研究者より高速かつ 1 時間あたり 4 ドルの低コストで修正可能にした。
リリース: 2026-08-28 · 読了 4

記事の要約

1. 核心(What)

  • Anthropic の AAR システムは Claude Opus 4.8 を搭載し、10 種類のアライメント失敗(脱獄やハルシネーション等)に対する自律的な事後学習メソッドの探索と検証を行う。
  • 1 回の実行につき最大 48 時間、1 基の H200 GPU を割り当て、MMLU、GSM8K、IFEval のスコア低下を防ぎながら性能を向上させる。
  • AAR 手法は平均 6.4 時間で最良の人間研究者の成果を上回り、コストは 1 時間あたり 4 ドルを達成した。
  • Claude Sonnet 5 は未成熟な Opus 4.8 チェックポイントに対し 2,000 例を用いて安全性ギャップの 65% を解消した。

2. 影響(Why)

  • 研究コストの劇的圧縮: 時給 150 ドルの人間による実験プロセスが 4 ドル/時間の API 費用に置き換わるため、安全性研究の経済的ボトルネックが解消される。
  • 国内評価組織への波及: 国内の LLM 開発・安全評価に携わる組織は、手動での試行錯誤から自動探索ハーネスを活用した効率的な検証体制へ移行するプレッシャーに直面する。

3. 根拠・詳細(How)

  • H200 GPU と 48 時間制限による探索: 各 AAR は 1 基の H200 GPU 環境下で 30 分間のモデル訓練と安全性ベンチマークのヒルクライミングを最大 48 時間反復する。
  • 3 から 5 種類のベンチマークによる汎化検証: 単一ベンチマークの過学習を防ぐため、各失敗に対して 3 から 5 種類のベンチマークスイートを適用し、真の行動変容を強制する設計。
  • 事前審査と監視機構の統合: 別の Claude Opus 4.8 モニターがトレーニングコードを事前読取し、ベンチマークリークや不正なデータ蒸留のショートカットを阻止する。

4. 展望・課題(Next)

  • コードとレポートのオープンソース化: 全レポートおよびハーネスコードが GitHub に公開されており、開発者は自身のモデル検証に組み込むことが可能。
  • 未監視領域への拡張課題: 現在のベンチマークや自動監査ツールで測定できないオープンエンドなアライメント失敗への適用は、今後の検証課題として残されている。