🧠Research🔥🔥

Google、動画生成モデル Gemini Omni 1.1 Flash を発表──4K アップスケーリングと 40 秒のシーン拡張に対応

前方のコンテキストを最大 10 秒まで分析して最大 40 秒までシーンを連鎖拡張できるほか、360p ドラフトモードと 4K アップスケーリングにより実制作ループを効率化する。
リリース: 2026-08-27 · 読了 3

記事の要約

1. 核心(What)

  • Google は生成動画モデルのアップデート版 Gemini Omni 1.1 Flash を公開し、Gemini API および Google AI Studio で提供を開始した。
  • シーン拡張機能は過去最大 10 秒のコンテキストを分析可能となり、連鎖させて最大 40 秒までの出力に対応した。
  • 360p ドラフトモードのレンダリング速度は従来比で最大 60% 高速化し、コストを 720p 生成時の 1/3 に削減する。
  • Adobe Firefly や Runway などの外部ツールやワークフローへの統合がパートナーシップを通じて進められている。

2. 影響(Why)

  • 実制作ワークフローへの統合コスト圧縮: 360p の安価なドラフト生成から 4K アップスケーリング、キーフレーム補間までの一連のループが単一の API で完結するため、動画編集ツール開発におけるパイプライン設計が大幅に簡素化される。
  • 国内動画生成 SaaS 事業者への影響: 国内の動画生成 SaaS や広告クリエイティブ制作を手がける中規模事業者は、キャラクターの同一性を維持したマルチターン編集を実装する際の下回りの基盤として、Veo 3.1 Fast 相当のコスト感で代替検証を進める価値がある。

3. 根拠・詳細(How)

  • previous_interaction_id によるコンテキスト維持: API 呼び出し時に previous_interaction_id を指定することで、Omni が直近 10 秒分のコンテキストを参照し、新規生成ではなく継続したシーン拡張として動作する仕組みをとっている。
  • マルチモーダル入力と参照動画の仕様: テキストや画像入力に加え、最大 3 秒間の参照動画をプロンプトに組み込むことで、キャラクターの顔立ちやスタイル、モーションの同一性を後続のカットでも維持できる。

4. 展望・課題(Next)

  • 音声入力の未対応と今後のロードマップ: 現時点では音声クリップを入力してリップシンク等を行う機能はサポートされておらず、パブリックプレビュー段階のためクォータやリージョン別の提供価格は今後変動する可能性がある。