🧠Research🔥🔥🔥

Ai2、学習フレームワーク Olmo-core 3 を公開──1.2 兆パラメータ MoE の訓練スループットを 2.7 倍に向上

エキスパートを GPU に常駐させる DDP 設計と MXFP8 導入により、メガクラス大規模 MoE の通信ボトルネックを解消した。
リリース: 2026-10-01 · 読了 4 分

記事の要約

1. 核心(What)

  • Allen Institute for AI (Ai2) がオープンな MoE 学習スタック Olmo-core 3 を公開した。
  • 8基の B300 GPU を用いた 47B MoE ベンチマークで、前世代比 2.7 倍のスループットを達成した。
  • FSDP から DDP への切り替えにより、エキスパートの重みを GPU に常駐させ通信コストを削減している。
  • 512 基の GPU を用いた 1.2 兆パラメータのシステムテストで、GPU 当たり 858 TFLOP/s を記録した。

2. 影響(Why)

  • 数兆パラメータ学習のハードル低下: 数兆パラメータ規模の MoE 学習でボトルネックとなる重み転送と通信オーバーヘッドを削減できるため、商用基盤に依存しない自前での大規模モデル構築が現実解に近づく。
  • 国内 LLM 開発組織への波及効果: 国内で独自の大規模 LLM 開発や MoE 検証を進める [国内 AI 研究機関・大手通信系研究所] などのチームは、商用スタックに頼らず数千基規模のクラスタ構築と最適化レシピを検証可能になる。

3. 根拠・詳細(How)

  • DDP とエキスパート並列の組み合わせ: 完全シャード型データ並列 (FSDP) で発生するバッチごとの重み再収集を廃止し、DDP ベースの設計でエキスパートを各 GPU に常駐させることでクロスデバイス間の重みトラフィックを回避する。
  • MXFP8 によるメモリと計算量の最適化: ブロックごとに独立したスケーリングを適用する 8 ビット浮動小数点形式 MXFP8 をサポートし、BF16 ベースライン比で約 21% のスループット向上とピークメモリの 103 GiB から 95 GiB への削減を同時に達成した。
  • ルーティングと通信パスの最適化機構: 行方向エキスパート並列による入力バッファへの直接書き込み、GPU 常駐型ルーティングによる CPU 待ち時間の削減、および Grouped GEMM による小規模行列乗算の統合を実装している。

4. 展望・課題(Next)

  • 学習品質と安定性の検証: 今回のテストはランダムルーティングを用いたシステム性能検証であり、トークンジェリマンダリングなどの失敗モードも報告されているため、フルスケールでの学習収束性とモデル品質の評価が今後の課題となる。