📜Papers🔥🔥

16B パラメータの自己回帰拡散モデル JoyAI-Video-Edit──Nvidia B200 単機で 720p・30 FPS のリアルタイム映像編集を実現

未来フレームを参照しない因果的生成と独自の蒸留手法により、16B モデルでありながら長時間の動画編集における時間的ドリフトを抑制しつつ 30 FPS を達成。
リリース: 2026-08-04 · 読了 5

論文概要

リアルタイムな映像編集においては、将来フレームへのアクセスがない状態での因果的生成と、限定的な計算資源での処理、さらには元映像の忠実度(Source Fidelity)と長時間の時間的一貫性の維持が課題となる。本論文では、16B パラメータを持つ自己回帰拡散モデル(Autoregressive Diffusion Framework)ベースのオープンエンド型動画編集手法「JoyAI-Video-Edit」を提案している。未来のフレームや事前の動画長を前提としないストリーミング処理により、Nvidia B200 GPU 単機で 720p 解像度において約 30 FPS のエンドツーエンド処理を達成した。

Figure 1: JoyAI-Video-Edit enables real-time, high-quality streaming video editing.

関連研究

従来のストリーミング型動画編集手法は、計算コストや遅延の制約から表現力が制限されるか、あるいは時間的ドリフト(累積誤差による破綻)を引き起こしやすいというトレードオフがあった。また、オフラインの高品質編集システムは全体を一括処理するためリアルタイム適用が不可能だった。本研究は、自己回帰的なアプローチを洗練させることで、オフラインシステムに匹敵する品質をストリーミング環境で実現している。

新規性と貢献

主要な貢献は以下の3点にある。

  1. 16B という大規模パラメータを持ちながら、ストリーミング形式で 30 FPS(720p)の高速なリアルタイム動画編集を実現した点。
  2. チャンク単位の自己回帰適応と、学習・推論時のギャップを削減する新しい蒸留手法の導入。
  3. 自動および人間の評価において、既存のストリーミングエディタを大きく凌駕し、オフラインシステムとも競合する性能を示した点。

提案手法の詳細

JoyAI-Video-Edit は、以下の主要コンポーネントを組み合わせて構成されている。

  • チャンク単位の自己回帰適応 (Chunk-wise Autoregressive Adaptation): 動画を時間方向のチャンクに分割し、過去のコンテキストのみを参照しながら因果的に生成を行うことで、リアルタイム性を担保する。
  • Source-Anchored Distribution Matching Distillation (SA-DMD): 2段階の生成プロセスにおいて元映像の忠実度を保持するため、分布マッチングに基づく蒸留を行い、元動画の特徴が損なわれるのを防ぐ。
  • Long-Horizon Autoregressive Distillation: 長時間の生成において蓄積しやすい時間的ドリフトを軽減するための専用蒸留スキーム。

Figure 2: Architecture of JoyAI-Video-Edit.

評価・考察

自動評価および人間の選好評価において、JoyAI-Video-Edit は既存のストリーミングビデオエディタに対して高い優位性を示した。特に、長短さまざまな動画に対してオフラインシステムと同等レベルの競争力を維持している。Nvidia B200 GPU を用いたランタイム解析では、720p の解像度で約 30 FPS のスループットを安定して記録しており、実時間処理の要件を十分に満たしている。

Figure 3: Runtime analysis of JoyAI-Video-Edit on an Nvidia B200 GPU.

応用例と今後の展望

本手法の応用により、放送・ライブ配信の現場や、インタラクティブな映像制作プラットフォームにおいて、高解像度(720p)かつ低遅延な AI 映像編集の組み込みが現実味を帯びる。日本のエンターテインメント業界やライブ配信サービス事業者の開発チーム(特にリアルタイムエフェクト処理を担うエンジニア)にとって、16B クラスの大規模モデルを実時間推論させるアーキテクチャ設計は、今後のシステム構築における強力なリファレンスとなる。

結論

JoyAI-Video-Edit は、16B パラメータの自己回帰拡散モデルに適切な蒸留手法とチャンク処理を導入することで、品質とリアルタイム性のトレードオフを克服した。B200 単機で 30 FPS(720p)を達成した本成果は、今後のストリーミング動画生成・編集のスタンダードに影響を与える。

注釈

  • 自己回帰拡散モデル: 過去の出力やフレームを順次入力としながら、拡散モデルによって確率的な生成を繰り返すアーキテクチャ。
  • SA-DMD: 元映像の分布と生成映像の分布をアンカーを基準に一致させることで、元動画の意図や質感を維持する蒸留手法。