Together AI、LLM 強化学習の不安定性を引き起こすバイアスを特定──スコアセンタリングによる補正手法を公開
推論サーバーと学習フレームワーク間の数値誤差が招くポリシーのドリフトを数理的に除去し、FP4/INT4 などの極端な量子化下でも安定した RL 訓練を実現した。
リリース: 2026-09-22 · 読了 3 分記事の要約
1. 核心(What)
- Together AI の研究者が、LLM 強化学習におけるトレーナーとサンプラー間の数値の不一致が引き起こす累積バイアス(ドリフト)を不安定性の根本原因として特定した。
- サンプラーでの期待スコアを差し引く加算補正手法「スコアセンタリング(score centering)」を提案し、コードと JAX 実装を GitHub で公開した。
- 30B スケールのモデルにおいて、厳格な FP4 や INT4 量子化環境下でも重要度サンプリングの破綻なしに安定した訓練を維持できる。
- トップ 128 の近似処理により、完全なスコアセンタリングと同等の性能を壁時計時間(wall-clock)のオーバーヘッド 1% 未満で実現している。
2. 影響(Why)
- 量子化 RL 訓練の現実解: FP4 や INT4 などの低精度化で崩壊していた RL 訓練が安定化するため、数千億パラメータ級のモデルにおける学習コストを実用的な水準まで削ることが可能になる。
- 国内 LLM 開発チームへの影響: [国内 AI 基盤モデル開発組織] のような自前で RL パイプラインを組むチームは、vLLM 等の推論エンジンと学習基盤の数値誤差に起因する訓練クラッシュのデバッグ工数を大幅に削減できる。
3. 根拠・詳細(How)
- スコアセンタリングによる加算補正: 各トークンプレフィックスにおけるサンプラーの期待スコアを数式的に差し引くことで、重要度比のクリッピングを行わずにポリシー勾配項のバイアスを除去する。
- 既存手法との組み合わせと実装: TIS(Trajectory Importance Sampling)や MIS と完全にコンポーズ可能であり、Qwen3-1.7B を用いた実験検証および JAX による実装が github.com/martin-marek/score-centering で提供されている。
4. 展望・課題(Next)
- 大規模モデルでのさらなる検証: 30B 超の商用スケールモデルにおけるスケーラビリティの検証や、より多様な量子化フォーマットへの適用拡大が今後の課題となる。