Microsoft、音声認識モデル MAI-Transcribe-2 を公開──1 時間あたり $0.10 で Whisper V3-Large 等を凌駕
Microsoft が話者分離と単語レベルのタイムスタンプを備えた音声認識モデルを公開し、競合の主要モデル比で低価格化と高精度化を同時に達成した。
リリース: 2026-09-03 · 読了 3 分記事の要約
1. 核心(What)
- Microsoft が音声認識モデル MAI-Transcribe-2 を公開し、Gemini 3.5 Transcribe、GPT-Transcribe、Whisper V3-Large をベンチマークで上回った。
- モデルは話者分離、設定可能な文字起こしスタイル、単語レベルのタイムスタンプを標準サポートする。
- 価格は音声 1 時間あたり 0.10 ドルに設定され、60 言語に対応する。
2. 影響(Why)
- 音声 API のコスト構造の転換: 1 時間あたり $0.10 という価格設定は、音声解析を組み込んだ文字起こしやコールセンター向け SaaS のインフラ原価を劇的に引き下げる。
- 国内音声 SaaS への原価圧力: 音声認識を自社サービスに組み込んでいる国内の音声テキスト化 SaaS 事業者は、API 料金の再改定やマージン見直しを迫られる。
3. 根拠・詳細(How)
- 多言語対応とタイムスタンプ機構: 60 言語の音声を単語レベルのタイムスタンプ付きで処理し、詳細な話者分離をパイプラインに統合する設計。
4. 展望・課題(Next)
- OpenAI 依存からの脱却加速: Microsoft は自社製フロンティアモデルを単一モダリティごとに構築し、従来 OpenAI 技術で稼働していた既存製品へ順次置き換える方針。