xAI、音声モデル Grok Voice Think Fast 2.0 を公開──0.70 秒の超低遅延で GPT-Realtime を撃破
音声対話の遅延を 0.70 秒に短縮し、Full Duplex Bench で 95.1% を記録。OpenAI Realtime API 互換で移行コストを圧縮する。
リリース: 2026-07-29 · 読了 3 分記事の要約
1. 核心(What)
- xAI は新型音声モデル Grok Voice Think Fast 2.0 の High バリアントを公開し、Artificial Analysis Index で 2 位にランクインした
- Tau Voice ベンチマークで 56.5% を記録し、Qwen Audio 3.0 Realtime Plus や GPT-Realtime-2.1 High を超えて首位を獲得した
- 音声入力から最初の音声出力までの時間を 0.70 秒に短縮し、上位モデル中最速のレスポンスを実現した
- 入力音声の価格は 1 時間あたり $4.80 に設定され、xAI API を通じて OpenAI 互換のインターフェースで提供される
2. 影響(Why)
- 遅延の壁を破る 0.70 秒: 1 秒を超える従来の音声モデルと異なり、0.70 秒の応答速度は人間同士の会話テンポに直結し、機械的なウェイトを感じさせない UX を提供する。
- 全二重対話の品質向上: Full Duplex Bench で 95.1% を達成したことで、ユーザーの割り込みやフィラー(相槌)の誤認識を抑え、実際の電話のような自然な対話制御が可能になる。
3. 根拠・詳細(How)
- Full Duplex Bench のスコア急上昇: 前世代モデル v1.0 の 77.8% から 95.1% へ向上した Full Duplex Bench のスコアが全体の品質底上げの主因となり、ターンテイキング制御が改善された。
- API 互換性と価格体系: OpenAI Realtime API との互換性を備え、価格は $4.80/hr(GPT-Realtime-2.1 High の $10.75/hr と比較して約 2.2 分の 1 のコスト)で xAI API から提供される。
4. 展望・課題(Next)
- 実運用環境での負荷検証: 高トラフィック時のレイテンシ変動や、多言語環境下での割り込み精度の維持について、実プロダクト環境での検証が進められる見通し。