Microsoft、ストリーミング文字起こしモデル MAI-Transcribe-2-Streaming を公開──音声合成 MAI-Voice-2.1 と高速版を同時リリース
音声の受信から100ミリ秒強で逐次認識する低遅延モデルと、23言語対応の多言語TTSをMicrosoft Foundryでパブリックプレビュー提供を開始した。
リリース: 2026-10-02 · 読了 3 分記事の要約
1. 核心(What)
- Microsoft AIは、初のストリーミング文字起こしモデル MAI-Transcribe-2-Streaming を発表し、音声受信から100ミリ秒強で暫定認識結果を出力する
- MAI-Transcribe-2-Streaming は日本語を含む60言語を自動判別し、年末まで音声1時間当たり0.54ドルで提供される
- 23言語対応の音声合成モデル MAI-Voice-2.1 と、45秒の音声を150ミリ秒で生成する高速版 MAI-Voice-2.1-Flash が同時に公開された
- モデル群は Microsoft Foundry および MAI Playground でパブリックプレビューとして提供され、東日本リージョンにも対応する
2. 影響(Why)
- リアルタイム音声対話のコストと遅延の壁を突破: 100ミリ秒強の遅延による逐次認識により、音声エージェントがユーザーの発話途中に割り込めるUXが実現し、不自然な間を排除した対話アプリを構築できる。
- 多言語コールセンター構築のAPIコスト最適化: 1つの声のままアクセントを維持して23言語を切り替えられるため、多言語対応の音声ボット運用のメンテナンスコストを大きく削減できる。
3. 根拠・詳細(How)
- ストリーミング認識と逐次修正のアーキテクチャ: 音声データの受信直後から100ミリ秒強で暫定的な認識結果を返し、文脈の進行に応じて結果を修正する仕組みを採用し、Artificial Analysis の評価で精度1位を獲得した。
- 音声合成の高速化と価格体系の分離: MAI-Voice-2.1-Flash は通常版と同等の品質を維持しながら 45秒の音声を 150ミリ秒で生成し、価格を 100万文字当たり 15ドルへと約60%安価に設定した。
- 音声複製機能のセキュリティ制御: 数秒の参照音声から声を複製する機能は、厳格な審査を経たアクセス承認と本人の同意取得を必須とする仕組みを組み込み不正利用を防止している。
4. 展望・課題(Next)
- 日本語応答を含むデモのアップデート: MAI Playground のデモ「Chatter」において、現状は英語に限定されている音声エージェントの応答設定へ日本語が正式追加されるかが今後の注目点となる。