Apple、Diffusion LLM 向け学習手法 DACA-GRPO を発表──数学やコード生成ベンチマークで最大 36.3pt 向上
Apple ML Research が、拡散モデル型 LLM の報酬最適化における時間的クレジット割当の欠如と尤度推定の偏りを解消する新手法 DACA-GRPO を公開した。
リリース: 2026-04-02 · 読了 3 分記事の要約
1. 核心(What)
- Apple ML Research は、Diffusion LLM の強化学習における報酬最適化の課題を解決する DACA-GRPO を提案した。
- 中間予測からトークンごとの重要度重みを抽出する Denoising Progress Scores を採用している。
- 平均場尤度のバイアスを軽減するため、トークン位置を階層に分割する Stratified Masking Likelihood を実装した。
- 数学的推論、コード生成、制約充足、制約付き生成を含む 7 つのベンチマークで一貫した改善を示した。
2. 影響(Why)
- 学習効率と推論コストの両立: 追加のフォワードコストなしでトークンごとの重要度を抽出できるため、計算資源が限られた環境でも GRPO の最適化効率を高められる。
- 国内実務への波及効果: [国内の高度なコード生成・スキーマ検証システムを開発する企業] は、自己回帰モデル特有のレイテンシ課題を回避する Diffusion LLM の実用化検証において、本手法を組み込むことで実用精度を担保できる。
3. 根拠・詳細(How)
- Denoising Progress Scores の導入: デノイジング軌跡全体にわたる時間的クレジット割当を行い、中間予測からトークンごとの重要度重みをフォワードコストなしで抽出する。
- Stratified Masking Likelihood によるバイアス軽減: トークン位置を複数の階層(strata)に分割し、各トークンがシーケンスの大部分をコンテキストとして予測されるように設計することで平均場尤度のバイアスを低減する。
4. 展望・課題(Next)
- 他モデルへの適用検証: 既存の 3 つの GRPO ベース手法以外の多様なアーキテクチャへの拡張性と、非英語圏設定における挙動の検証が今後の課題となる。