Allen AI、大規模 MoE 向け学習基盤 Olmo-core 3 を公開──総パラメータ 1.2 兆超えの分散学習を効率化
Expert Parallelism や MXFP8 導入により、前世代の FSDP 方式比で約 2.7 倍のトレーニングスループットを達成した。
リリース: 2026-10-01 · 読了 4 分記事の要約
1. 核心(What)
- Allen AI は大規模 MoE(Mixture-of-Experts)の分散学習を効率化するオープンフレームワーク「Olmo-core 3」を公開した。
- Expert parallelism、Pipeline parallelism、Distributed optimizer を統合し、1 兆パラメータを超える超大規模モデルのスケーリングを可能にした。
- Fully sharded data parallelism (FSDP) から distributed data parallelism (DDP) ベースのアーキテクチャへ移行し、モデルウェイトの繰り返し集約コストを削減した。
- MXFP8 形式のサポートや rowwise expert parallelism により、通信・演算のオーバーヘッドを最適化している。
2. 影響(Why)
- MoE スケーリングのボトルネック解消: パラメータ数増大に伴う GPU 間通信コストの増大をアーキテクチャレベルで抑えることで、計算効率の低下を防ぎながら大規模化を達成できる。
- オープンな学習インフラの解放: モデルの重みだけでなく、その背後にある複雑な分散学習インフラが公開されるため、外部の研究者が独自のハードウェア環境で大規模 MoE の挙動を再現・検証できるようになる。
3. 根拠・詳細(How)
- DDP ベースのルーティングとウェイト保持: FSDP 方式から DDP ベースへ移行し、エキスパートを各 GPU に常駐させて関連データをルーティングすることで、小バッチごとのウェイト再集約処理を回避している。
- MXFP8 によるメモリ削減とスループット向上: NVIDIA B300 GPU 4 基を用いた制御ベンチマークにおいて、MXFP8 を適用することで BF16 ベースライン比でスループットが約 21% 向上し、ピークメモリが 103 GiB から 95 GiB へ減少した。
- 大規模分散でのスケーリング実績: 512 基の NVIDIA B300 GPU を用い、58.36B アクティブパラメータを持つ 1.2 兆パラメータモデル構成で最高 858 TFLOP/s/GPU のスループットを記録した。
4. 展望・課題(Next)
- 次世代 Olmo モデルへの適用: 本フレームワークは、コンテキスト長を拡張した次世代 MoE 版 Olmo の学習基盤として直接活用される予定である。
- オルタナティブな通信手法の検証: DeepEP v2 などの代替通信手法を用いた 2.38 兆パラメータ規模の短時間テストなど、さらなるスケーリング限界の検証が続けられている。