🧠Research🔥🔥

Apple ML Research、言語モデル向け 1.7B パラメータ Categorical Flow Maps を公開──2.1T トークンでスケーラビリティを実証

Apple ML Research は、1.7B パラメータのベースフローモデルを 2.1T トークンで学習し、4 推論ステップでのテキスト生成と標準 LM ベンチマークでの同等性能を実証した。
リリース: 2025-11-12 · 読了 3

記事の要約

1. 核心(What)

  • Apple ML Research は 1.7B パラメータのベースフローモデルを 2.1T トークンの大規模データで学習した。
  • 自己蒸留(self-distillation)により、わずか 4 推論ステップで多様かつ高品質なテキストを生成する Categorical Flow Maps (CFMs) を構築した。
  • セミディスクリート設定における尤度境界(likelihood bound)を導入し、標準 LM ベンチマークでの評価を可能にした。
  • ロス重み付けとタイムスケジューリングに関するスケーリング時の課題と処方箋的知見を明らかにしている。

2. 影響(Why)

  • 自己回帰の計算ボトルネックを迂回する選択肢: トークンを順次生成する自己回帰型モデルのレイテンシ課題に対し、4 ステップ生成を実証したことで、次世代の高速な推論アーキテクチャの実験基盤として検討する価値が出てきた。
  • 国内音声・テキスト統合開発への示唆: 大規模言語モデルの推論高速化に特化した基盤研究を進める国内の音声認識・LLM 開発組織(国立研究所や一部の特化型 AI ベンチャー等)において、Flow Matching 系のスケール則を検証する際の重要なベンチマークになる。

3. 根拠・詳細(How)

  • 1.7B パラメータと 2.1T トークンによる学習: ガウス分布と one-hot エンコードされたデータ分布間のシンプルなフローマッチングプロセスを採用し、1.7B パラメータのモデルを 2.1T トークンで訓練してスケーラビリティを検証した。
  • セルフディスティレーションと 4 ステップ生成: ベースフローモデルをセルフディスティレーションすることで、近データレベルのトークンエントロピーを維持したまま、4 推論ステップでの高速サンプリングを実現した。

4. 展望・課題(Next)

  • 大規模スケーリングにおける課題の克服: 1B 未満の小規模評価から 1.7B へのスケールアップ時に発生したロス重み付けの調整課題に対し、さらなる大規模化における安定化手法の検証が求められる。