動画生成のアライメントと蒸留を単一ステージで統合する最適化手法 DM-Align
Distribution Matching を基盤に選好データと蒸留の勾配を統合し、マルチステップの報酬評価やモデル崩壊を回避しながら高品質な動画生成を実現した。
リリース: 2026-09-03 · 読了 5 分論文概要
動画生成モデルの人間選好アライメント(Human Preference Alignment)は、強化学習(RL)に依存するため莫大な計算コストがかかっていた。先行研究では、RLとモデル蒸留を別個のステージとして扱うのが主流であり、蒸留前にRLを適用すると法外なコストがかかり、蒸留後にRLを適用するとモデル崩壊を引き起こしやすいというジレンマがあった。本論文では、Distribution Matching(DM)を基盤とした統合型単一ステージ最適化フレームワーク「DM-Align」を提案し、蒸留品質と選好アライメントを同時に向上させる手法を報告している。

関連研究
従来の動画生成における選好アライメントは、DPO(Direct Preference Optimization)やGRPO(Group Relative Policy Optimization)などの手法をベースに発展してきた。しかし、これらは多くの場合、事前訓練された高コストな拡散モデルを対象に多段階の報酬評価や複雑なODE-SDE変換を必要とする。本研究は、従来の分割されたマルチステージ・パイプラインとは異なり、DMの枠組みの中でアライメントと蒸留を直接結びつける点で異なる。
新規性と貢献
本研究の最大の貢献は、現実のモデルと偽のモデル間のギャップを最小化するDMの勾配方向に対し、人間の選好に導かれたサンプル群からの補完的な勾配を直接組み合わせる「単一ステージ最適化」の確立にある。これにより、従来必要とされていたマルチステップの報酬評価や複雑なサンプリング変換を完全に排除し、計算効率を大幅に改善した。
提案手法の詳細
DM-Alignでは、通常のDMフレームワークにおける分布ギャップ最小化の勾配に加え、DPOやGRPOの着想を取り入れた選好ガイド付きの勾配を構築する。ペアワイズの選好データやグループ内探索から得られた情報を用いて、生成モデルがより高忠実度かつユーザーの意図に沿った動画を生成できるように誘導する。

評価・考察
複数の基盤となる動画生成モデルを用いた総合的な実験により、提案するサンプルガイド型フレームワークが、単体のバリアントや従来の逐次的な2段階パイプラインを一貫して上回るパフォーマンスを発揮することが実証された。

応用例と今後の展望
実務インフラへのインパクトとして、商用動画生成サービス(例: エンターテインメント業界やマーケティング向け動画自動生成システム)において、モデルアライメントと蒸留のパイプライン統合により計算コストを削減できる可能性がある。今後の課題としては、より多様なマルチモーダル選好データへのスケーラビリティ検証が挙げられる。
結論
DM-Alignは、動画生成モデルの選好アライメントと蒸留における構造的課題を解決する単一ステージ最適化フレームワークであり、計算上のオーバーヘッドを抑制しながら生成品質を著しく高めることが示された。
注釈
- Distribution Matching (DM): 生成モデルの出力分布とターゲットのデータ分布の差を最小化する枠組み。
- DPO (Direct Preference Optimization): 報酬モデルを明示的に学習せず、直接選好データからポリシーを最適化する手法。