🧠Research🔥🔥

Google Research、長尺動画生成モデル群を発表──Gemini と Veo で 10 分間の連続性を最適化

Gemini と Veo を統合した 4 つのエージェントシステムにより、キャラクターや小物の維持、シーン間の整合性を保った 10 分間の長尺動画生成を実現した。
リリース: 2026-09-24 · 読了 4 分

記事の要約

1. 核心(What)

  • Google Research が Gemini と Veo を組み合わせて長尺動画生成時の連続性崩壊を防ぐ 4 つの統合エージェントシステムを発表した。
  • AI Video Co-Director はマルチアームバンディットを用いてクリエイティブ戦略、ナラティブモード、美的表現を最適化する。
  • CANVAS はキャラクター、場所、オブジェクトの状態を永続的なビジュアルメモリとして保持し、カット間のアイデンティティ崩れを防ぐ。
  • A²RD は外挿と補間を切り替えながら最大 10 分間の動画を自動回帰的に生成し、VQQA は視覚言語モデルの批評をプロンプト更新へ変換する。

2. 影響(Why)

  • 長尺生成の破綻を防ぐ実用的な設計: 現行の動画生成モデルは数秒のクリップ制作には優れるが、複数回の呼び出しで衣服や小物が変わる破綻があった。本フレームワークのメモリ管理と評価機構の導入により、商用クオリティの長尺映像制作における手動修正コストを大幅に削減できる。
  • 国内映像制作・SaaS 事業者への影響: 動画制作ツールやエンタメ系 SaaS を展開する国内の中堅・大規模事業者は、自社ワークフローへのマルチエージェント型オーケストレーション導入を前提とした、次期プロダクトの構成見直しを迫られる。

3. 根拠・詳細(How)

  • AI Video Co-Director の最適化構造: オーケストレーターエージェントがマルチアームバンディットアルゴリズムを用いてクリエイティブ戦略・ナラティブモード・美的表現を探索し、プリプロダクションから音声・映像生成までの下流エージェントに共通のガイダンスとして共有する。
  • A²RD の生成モード切り替え機構: セグメントごとにマルチモーダルメモリから参照し、新しいアクションを導入する外挿と、既存のキャラクターや環境をつなぎ合わせる補間を動的に切り替えることで、最大 10 分間の整合性を保つ。

4. 展望・課題(Next)

  • 公開状況と今後の実装: 現時点ではプレプリント論文とベンチマークリポジトリが公開されているのみであり、公式 API やオープンソース実装は提供されていない。