Google、音声生成モデル Gemini 3.8 Flash TTS を公開──ゼロからの声作成と 130 言語対応を実現
自然言語の指示で新しい声をゼロから構築でき、音声デザインベンチマークで 1 位を獲得した長尺・対話対応 TTS モデル。
リリース: 2026-09-24 · 読了 3 分記事の要約
1. 核心(What)
- 米Googleは9月23日、テキスト音声生成モデル「Gemini 3.8 Flash TTS」と軽量版「Gemini 3.8 Flash-Lite TTS」を発表した。
- Flash TTSは130言語、Flash-Lite TTSは101言語に対応し、日本語の音声生成やボイスレプリケーションを利用できる。
- Gemini APIやGoogle AI Studio、Gemini Notebookなどで順次提供され、有料プランの料金は100万トークン当たりFlash TTSが出力9ドルなどと設定されている。
2. 影響(Why)
- 既定音声の限界を超える声のカスタマイズ: 従来の30種類の固定音声から選ぶ方式から、自然言語のプロンプトで役柄やアクセントを指定して新しい声をゼロから生成できる方式へ移行し、キャラクター表現の幅が飛躍的に広がる。
- 国内エンタメ・音声エージェント開発への波及: [国内ゲーム開発・音声メディア事業] などの組織は、キャラクターごとの声の作り分けや長尺ポッドキャストの自動生成コストを大幅に削減できるため、音声コンテンツの制作パイプラインを再設計するインセンティブが生じる。
3. 根拠・詳細(How)
- 音声デザインベンチマークでの性能: 米Hume AIが公開する音声デザインのベンチマークで、Flash TTSが総合1位(71.4)、アクセント表現でトップ(60.8)を記録した。
- 電子透かしと来歴認証の実装: 生成音声にはGoogleの電子透かし技術「SynthID」を埋め込み、ボイスレプリケーションには「C2PA」の認証情報を付与してAI生成の検出と来歴管理を担保する。
4. 展望・課題(Next)
- ボイスリミックス機能の追加予定: ライブラリの声の音色や高さ、話す速さをプロンプトで調整するボイスリミックス機能が近く提供される予定である。