🛠Tools🔥🔥

AWS、検索エージェント基盤 Amazon SageMaker AI MTRL を公開──Qwen3.6-27B のマルチターン強化学習をサーバーレス化

Amazon SageMaker AI にマルチターン強化学習基盤を統合し、Qwen3.6-27B の検索エージェント最適化をサーバーレス環境で実行可能にした。
リリース: 2026-10-02 · 読了 3 分

記事の要約

1. 核心(What)

  • AWS は Amazon SageMaker AI にマルチターン強化学習(MTRL)機能を追加し、Qwen3.6-27B を用いた検索エージェントの最適化手順を公開した。
  • 評価指標として nDCG@10 を直接用いた軌跡レベルの報酬設計を採用し、最大ターン数超過やサンプリング上限到達時にはペナルティ(-1)を付与する。
  • BrowseComp-Plus で +23.7%、WixQA で +18.4% の nDCG@10 向上を記録し、すべての保持ベンチマークで信頼性が向上した。

2. 影響(Why)

  • マルチターン依存関係の最適化: 単一ターンの報酬最適化では捉えられない複数ステップにわたる意思決定の依存関係を解決し、実用的な検索精度を実現する。
  • 国内エンタープライズへのコスト効果: サーバーレス実行と per-token 料金モデルにより、GPU クラスターの管理コストを排除しつつカスタムエージェントを運用できる。

3. 根拠・詳細(How)

  • マルチターン強化学習アーキテクチャ: MultiTurnRLTrainer SDK を用いて、max_epochs=1、global_batch_size=128、rollout_max_concurrency=32 の 3 つのハイパーパラメータ調整のみで学習を実行。
  • 検索ツールの統合と報酬関数: BM25 による語彙検索とベクトル検索をエージェントに紐付け、上位10件のランキング評価値(nDCG@10)を直接の報酬シグナルとして活用。

4. 展望・課題(Next)

  • リージョン展開の制約: 現時点では US West (Oregon) リージョン(us-west-2)でのサポートとなっており、今後の他リージョン展開が待たれる。