🛠Tools🔥🔥

AWS、推論サーバー Amazon EKS と EFA による MoE 強化学習基盤を公開──40% のスループット向上を実現

Amazon EKS 上で MoE モデルの RLHF や GRPO を大規模実行するアーキテクチャを公開し、EFA と DeepEP の活用で通信オーバーヘッドを抑制した。
リリース: 2026-09-25 · 読了 3 分

記事の要約

1. 核心(What)

  • Amazon EKS を用いて、ロールアウト生成とポリシー学習の異種ワークロードを分離・オーケストレーションするアーキテクチャを定義
  • Elastic Fabric Adapter (EFA) と DeepEP の統合により、スパースな MoE モデルに起因するダイナミックな all-to-all 通信を高速化
  • Amazon S3 をデータセットやチェックポイントの永続化ストレージとして独立させ、各レイヤーをスケーラブルに分離

2. 影響(Why)

  • 通信律速の回避: スパース性が高い MoE モデルはエキスパート並列時の all-to-all 通信がボトルネックになるため、EFA による低遅延化がトレーニング全体の効率を左右する。
  • 国内インフラ設計への示唆: [国内クラウド基盤提供事業者] のような組織では、Kubernetes ベースの分散強化学習基盤を構築する際、通信と計算のリソース分離設計をそのままリファレンスとして利用できる。

3. 根拠・詳細(How)

  • EFA と DeepEP の連携: NVIDIA GPUDirect RDMA と OS バイパスを利用して、CPU や OS を介さずに GPU メモリバッファ間で直接データ転送を行い、ノード間の通信オーバーヘッドを最小化する。
  • EKS クラスターの分離構成: GPU インスタンスでロールアウト生成やポリシー学習を実行しつつ、CPU インスタンスで環境評価、メモリ最適化インスタンスでエクスペリエンスバッファをホストする。

4. 展望・課題(Next)

  • 実装の検証と適用: 実際の P5/P6 インスタンス環境でのベンチマーク検証や、大規模 GRPO ワークロードへの適用テストが進められる予定。