📜Papers🔥🔥

397B パラメータのテキスト動画生成向けプロンプト拡張モデル WanPE──30 秒生成で人間の好ましさを 50.86pt 向上

動画グラウンデッド逆構築と SC-GRPO により、30秒の長尺動画における一貫性と演出力を大幅に向上させた。
リリース: 2026-09-24 · 読了 4 分

論文概要

現代のテキスト動画生成モデルは 30 秒の長尺化や複雑な条件付けへの追従を実現しつつあるが、演出プランを担うテキストプロンプトの設計が生成品質を大きく左右する。本論文では、ディレクターレベルの映画的プランニングを習得させるため、105 万件の実世界動画で訓練された 397B パラメータのプロンプト拡張モデル「WanPE」を提案する。WanPE は動画グラウンデッド逆構築(video-grounded reverse construction)を用いてショットレベルのシネマティックプランを定式化し、Semantic-Consistency GRPO(SC-GRPO)を採用して複数ショットや長期にわたるユーザー要件の一貫性を維持する。評価用として 5 秒から 30 秒までの長さにわたる人間アノテーション付きテストベッド「WanPEval」を構築し、約 11,000 件のブラインドペアワイズ評価を実施したところ、Wan3.0 の動画生成において、WanPE-397B は生プロンプトと比較して 5〜15 秒で 10.66〜18.84 ポイント、30 秒の領域では 50.86 ポイントもの大幅な人間の好みによる選好向上を実証した。

関連研究

テキスト動画生成におけるプロンプト拡張や長文脈コンテキストの制御に関する従来手法は、主にフォワードリライティング(順方向書き換え)をベースとしていた。しかし、これらは複数ショットにわたる一貫したカメラワークやアクションの維持が困難であった。本研究では、動画からの逆構築アプローチを導入することで、従来手法の限界を克服している。

新規性と貢献

本研究の主要な貢献は以下の通りである。

  1. 397B パラメータの大規模プロンプト拡張モデル WanPE の提案。
  2. 動画グラウンデッド逆構築および Semantic-Consistency GRPO (SC-GRPO) の導入による、ショット間の意味的一貫性の保持。
  3. 5 秒から 30 秒の長尺動画に対応する人間アノテーション付きベンチマーク「WanPEval」の公開と、大規模なブラインド評価による実証。

提案手法の詳細

WanPE は、動画データを基点として逆向きにプロンプトや演出プランを構築する「動画グラウンデッド逆構築」を採用している。これにより、単なるキーワードの羅列ではなく、カメラ軌道、照明、音響、アクションの展開を含むディレクターレベルのシネマティックプランを生成する。また、学習時には SC-GRPO(Semantic-Consistency GRPO)を用いることで、モデルのスケール全体にわたって意味的忠実度を堅牢に維持する設計となっている。

評価・考察

11,000 件のブラインドペアワイズ評価を用いた WanPEval ベンチマークテストの結果、Wan3.0 と組み合わせた WanPE-397B は、生プロンプトと比較して 5〜15 秒の範囲で 10.66〜18.84 ポイントの向上を記録し、30 秒の長尺領域では 50.86 ポイントという劇的な向上を示した。アブレーションスタディでは、順方向書き換えに対する逆構築の優位性や、SC-GRPO がスケールを通じて一貫性を維持する効果が裏付けられている。また、WanPE は 5〜15 秒の範囲ですべての評価済み商用提供モデルをリードし、30 秒でも Seedance 2.5 と同等の競争力を維持している。

応用例と今後の展望

エンターテインメントや広告制作などの映像制作分野において、クリエイターが意図する複雑なカメラワークや長尺のストーリーラインを自動生成するワークフローへの実務インパクトが期待される。特に国内の映像制作会社やメディア関連の R&D 部門(10人〜100人規模の制作チーム等)において、プロンプトエンジニアリングの自動化と品質底上げに向けた有力な基盤技術となる。今後の課題としては、さらなる推論の効率化や、より多様な文化的コンテキストへの適応が挙げられる。

結論

本論文では、397B パラメータのプロンプト拡張モデル WanPE を提案し、動画逆構築と SC-GRPO により長尺動画生成における映画的演出と意味的一貫性の飛躍的な向上を実現した。WanPEval による厳格な評価を通じて、長文脈の動画生成におけるプロンプト拡張の重要性と有効性が実証された。

注釈

  • SC-GRPO: Semantic-Consistency Group Relative Policy Optimization。強化学習の枠組みを用いて、出力間の一貫性を保ちながら方策を最適化する手法。
  • WanPEval: 本研究で新たに構築された、5〜30 秒の長さにわたる意図の粒度をカバーする人間アノテーション付きテストベッド。