📜Papers🔥🔥

長時間音声・動画同時生成手法 Encore──適応型シグナルルーティングにより整合性を維持

長時間の音声・動画を同時生成する Encore は、適応型シグナルルーティング(ASR)と文脈伝播により、ビデオの時間的整合性とクロスモーダル同期を維持しつつ無限長の生成を実現した。
リリース: 2026-08-28 · 読了 5

論文概要

従来の音声・動画生成手法は短いクリップの生成に特化しているか、長時間の動画生成では音声が完全に欠落するという課題があった。本論文では、長時間における同期された音声・動画生成を実現する手法として Encore を提案する。Encore は、局所的な連続性と大域的な一貫性を分離して処理する設計を採用し、拡張されたベンチマークである VerseBench において既存手法を上回る生成品質と時間的整合性を実証した。

関連研究

これまでの音声・動画生成手法は短いクリップの同期には成功しているものの、チャンクベースの反復合成による長尺動画生成手法は音声モダリティを扱えないという制約があった。音声と動画の同時生成は、ビデオの時間的整合性、音声の時間的整合性、およびクロスモーダル同期を同時に維持する必要があるため、単一のタスクよりも本質的に困難である。

新規性と貢献

本研究の主要な貢献は、(1) 明示的なチャンク間コンテキスト伝播による反復生成を用いた局所的連続性の担保と、(2) シフト位置埋め込みを持つ参照音声・動画信号による大域的一貫性の強制、という 2 つの要素への課題の分解にある。これにより、エンドツーエンドの訓練と推論時における無限長の音声・動画の相互変換(Audio-to-Video / Video-to-Audio)が可能になった。

提案手法の詳細

提案手法の核心となるのは Adaptive Signal Routing (ASR) である。ASR は自己注意機構(Self-Attention)内に学習可能なアテンションバイアスを導入し、さらにクロス注意機構(Cross-Attention)の出力に対して学習可能な残差スケールを適用する。これにより、モデルは各条件付け信号の影響力を適応的に変調することが可能となり、異なる経路から入力される条件付け信号を統合する。

評価・考察

長時間の音声・動画評価のために拡張された VerseBench を用いた実験において、Encore は生成品質および時間的整合性の両面で既存手法を大きく上回る性能を示した。各チャンクがビデオと音声の双方の時間的整合性、およびクロスモーダルな同期を同時に維持できることが確認されている。

応用例と今後の展望

本手法は、実写映画のロングシークエンス生成やインタラクティブなマルチメディア制作において実用的なインパクトを持つ。特に日本のエンターテインメント・アニメーション制作分野において、長時間にわたる高品質な音声と映像の自動生成ワークフローへの応用が期待される。今後はより長尺なコンテキストでの計算効率の最適化が課題となる。

結論

Encore は、適応型シグナルルーティングと明示的なコンテキスト伝播を活用することで、長時間の同期された音声・動画の同時生成および無限長のクロスモーダル合成を可能にするスケーラブルなアプローチを提示した。

注釈

  • クロスモーダル同期: 音声と映像のタイミングや内容が正確に一致している状態を指す。
  • Adaptive Signal Routing (ASR): 複数の異なるモダリティからの条件付け信号の重要度を動的に調整する機構。