🧠Research🔥🔥🔥

Reflection AI、オープンモデル Beam を発表──501B パラメータと大規模強化学習で推論効率を最適化

501B の巨大 MoE モデル Beam を公開し、10.5K 基の NVIDIA GB300 を用いた大規模強化学習により推論コストを従来比で 3〜4 倍圧縮した。
リリース: 2025-08-09 · 読了 4 分

記事の要約

1. 核心(What)

  • Reflection AI は総パラメータ数 501B、アクティブ 23B の MoE モデル Beam を開発した。
  • 事前学習には 23.8 兆トークンが使用され、10.5K 基の NVIDIA GB300 GPU で 4 週間にわたり 1 億回以上のロールアウト生成が行われた。
  • ユーザーが応答の長さを調整できる reasoning effort パラメータを搭載し、タスクの難易度とコストのバランスを制御可能にしている。

2. 影響(Why)

  • 推論コストの大幅な削減: 同等性能のモデルに比べ 3〜4 倍少ない推論計算量で動作するため、大規模なエージェントワークロードを運用する際のインフラコストを劇的に引き下げる。
  • 国内エンタープライズへの適用性: 社内データを用いたファインチューニングや VPC 内でのセキュアな運用が可能なため、セキュリティ要件の厳しい国内金融・医療系の開発チームが高度な推論タスクを内製化しやすくなる。

3. 根拠・詳細(How)

  • 非同期強化学習パイプライン: ポリシーの古さによる不安定性を解消するため非同期学習アルゴリズムを導入し、1 日以上前に生成されたインタラクションからの学習でも安定性を維持した。
  • 安定した MoE 最適化: 補助損失なしの負荷分散と深さベースのスケーリングを組み合わせることで、活性化の増大や外れ値を抑え、全レイヤーで健全な信号伝播を実現した。

4. 展望・課題(Next)

  • モデルウェイトと技術レポートの公開: 月内にもモデルウェイト、技術レポート、モデルカード、開発者向け成果物が順次リリースされる予定である。