Google、動画生成機能付きモデル Gemini 3.8 Live with Live Avatar を Gemini Enterprise 向けに公開──音声とニアリアルタイム動画のマルチモーダル統合を実現
Gemini 3.8 Live をベースにリップシンクや表情変化を伴う動的ビジュアルペルソナを追加し、97言語のマルチリンガル対話やバックグラウンドでの非同期ツール実行を単一の統合APIで提供する。
リリース: 2026-09-24 · 読了 3 分記事の要約
1. 核心(What)
- Google、Gemini 3.8 Live にニアリアルタイムの動画生成と音声対話を統合した Gemini 3.8 Live with Live Avatar を発表
- Gemini Enterprise 向けに提供が開始され、会話を中断せずに非同期でツール呼び出しやデータ取得を実行可能
- リップシンクや表情の変化を伴うマルチリンガル対話が、画質や視覚的ズレの発生なしに 97 言語で切り替え可能
- 音声と動画の出力全体に SynthID によるウォーターマークが埋め込まれ、商用環境での透明性を確保
2. 影響(Why)
- マルチモーダル対話の実装コスト圧縮: 音声合成と動画生成を個別パイプラインで構築していた顧客向けシステムを単一 API に集約できるため、開発チームはフロントエンド側の映像同期処理の実装負荷を大幅に削減できる。
- 国内カスタマーサービス SaaS への影響: 国内のコンタクトセンター向けシステムや音声対話 SaaS を展開する中規模事業者にとって、97言語対応の動的アバターを既存の Gemini Enterprise 基盤経由で組み込めるため、海外顧客向け多言語窓口の構築スピードが加速する。
3. 根拠・詳細(How)
- 非同期ツール実行アーキテクチャ: 対話フローを中断させずにバックグラウンドでホテルチェックイン等の複雑なタスクやデータ取得を実行するため、Gemini の推論エンジンが非同期の関数呼び出しを並行処理する設計となっている。
- SynthID によるウォーターマーク統合: 生成される音声と動画の出力に対して、誤情報や誤帰属の防止を目的とした知覚困難な電子透かしである SynthID が直接埋め込まれる仕様になっている。
4. 展望・課題(Next)
- カスタムアバター生成の提供拡大: 高品質なリファレンス画像からブランド独自の動的アバターを生成する機能は、現時点で Enterprise のアロワリスト(許可リスト)方式による限定提供となっており、今後の一般展開スケジュールが注目される。