🧠Research🔥🔥

Google、リアルタイム音声モデル Gemini 3.8 Live を発表──音声認識インデックスで 82.6 を記録し多段階推論を統合

ネイティブ音声モデルと多段階推論を統合し、音声会話中のバックグラウンドツール実行や 97 言語の自動切替を実現した。
リリース: 2026-09-15 · 読了 4

記事の要約

1. 核心(What)

  • Google がリアルタイム音声モデル「Gemini 3.8 Live」および「Gemini 3.8 Live Extended Thinking」を公開した。
  • Extended Thinking は Artificial Analysis Speech-to-Speech Index で 82.6 を記録し首位を獲得した。
  • tau-Voice エージェントタスクで 68.6%、Big Bench Audio で 97.7% のスコアを達成した。
  • 97 言語の自動検出とセッション中のバックグラウンドツール実行をネイティブにサポートする。

2. 影響(Why)

  • 音声エージェント実装の工数削減: 従来の ASR・LLM・TTS を直列につなぐパイプラインと異なり、単一セッションでネイティブ処理するためレイテンシ管理と割り込み処理の実装コストが大幅に下がる。
  • 国内カスタマーサポートへの影響: コールセンター SaaS などの国内事業者は、バックグラウンドでの API 呼び出しや多言語切替を標準備えた音声モデルへ移行することで、無音区間を削減した対話 UX を構築できる。

3. 根拠・詳細(How)

  • 単一セッションによるネイティブ音声処理: 音声・視覚入力・ツール実行を単一のモデルセッション内で同期処理し、ストリーミングオーディオを直接処理することでハンドオフ時の情報ロスを抑制する。
  • Extended Thinking によるステータス通知: 多段階の推論タスク実行中に隠し推論を維持したまま音声で進捗ステータスを返し、API 応答待ちの無音時間を埋める設計を採用している。

4. 展望・課題(Next)

  • エンタープライズ向け提供と仕様の公開: レイテンシ分布、セッション制限、価格体系などの詳細な本番運用向け数値は未公開であり、今後の各プロダクト展開を待つ必要がある。