🎨Product🔥🔥

Google、音声認識モデル Gemini 3.5 Transcribe を発表──ライブ音声のエラー率を 5.5% に低減

フィラーの自動除去やカスタム用語の適用機能を備え、従来モデル Chirp 3 比で音声からテキスト変換までの速度を約 70% 高速化した。
リリース: 2026-08-26 · 読了 2

記事の要約

1. 核心(What)

  • Google は音声認識特化型 AI モデル Gemini 3.5 Transcribe を発表した
  • 従来エンジンの Chirp 3 と比較して、音声から最終テキスト化までの速度が約 70% 高速化した
  • ライブ音声の単語誤り率 (WER) は 5.5% に低減され、Chirp 3 の 7.32% から改善された
  • 85 言語に対応し、事前録音された音声では最大 3 話者までの識別が可能である

2. 影響(Why)

  • 音声入力アプリの実装コスト削減: フィラー除去やカスタム用語処理がモデル側で完結するため、国内の文字起こし SaaS 開発事業者は後処理の自然言語処理パイプラインを削減できる。
  • リアルタイム応答の UX 向上: 速度が 70% 向上したことで、音声アシスタントや議事録ツールの応答遅延が解消され、商用サービスのユーザー離脱を防ぐ選択肢になる。

3. 根拠・詳細(How)

  • ノイズ除去とリアルタイム編集機構: 発話中のフィラー(「えーと」など)をリアルタイムで削除し、言い直しをその場で補正するストリーミング処理を実装している。
  • カスタムボキャブラリー対応: 指定した専門用語リストを参照することで、業界固有の難読語や専門ジャーゴンの認識精度を維持する。

4. 展望・課題(Next)

  • Google エコシステムへの展開: Pixel 11 の Gboard 「Rambler」機能での先行実装を皮切りに、Google の各種サービスへ順次統合される予定である。