🧠Research🔥🔥

xAI、音声モデル Grok Voice Think Fast 2.0 を公開──0.70 秒の超低遅延で GPT-Realtime を撃破

音声対話の遅延を 0.70 秒に短縮し、Full Duplex Bench で 95.1% を記録。OpenAI Realtime API 互換で移行コストを圧縮する。
リリース: 2026-07-29 · 読了 3

記事の要約

1. 核心(What)

  • xAI は新型音声モデル Grok Voice Think Fast 2.0 の High バリアントを公開し、Artificial Analysis Index で 2 位にランクインした
  • Tau Voice ベンチマークで 56.5% を記録し、Qwen Audio 3.0 Realtime Plus や GPT-Realtime-2.1 High を超えて首位を獲得した
  • 音声入力から最初の音声出力までの時間を 0.70 秒に短縮し、上位モデル中最速のレスポンスを実現した
  • 入力音声の価格は 1 時間あたり $4.80 に設定され、xAI API を通じて OpenAI 互換のインターフェースで提供される

2. 影響(Why)

  • 遅延の壁を破る 0.70 秒: 1 秒を超える従来の音声モデルと異なり、0.70 秒の応答速度は人間同士の会話テンポに直結し、機械的なウェイトを感じさせない UX を提供する。
  • 全二重対話の品質向上: Full Duplex Bench で 95.1% を達成したことで、ユーザーの割り込みやフィラー(相槌)の誤認識を抑え、実際の電話のような自然な対話制御が可能になる。

3. 根拠・詳細(How)

  • Full Duplex Bench のスコア急上昇: 前世代モデル v1.0 の 77.8% から 95.1% へ向上した Full Duplex Bench のスコアが全体の品質底上げの主因となり、ターンテイキング制御が改善された。
  • API 互換性と価格体系: OpenAI Realtime API との互換性を備え、価格は $4.80/hr(GPT-Realtime-2.1 High の $10.75/hr と比較して約 2.2 分の 1 のコスト)で xAI API から提供される。

4. 展望・課題(Next)

  • 実運用環境での負荷検証: 高トラフィック時のレイテンシ変動や、多言語環境下での割り込み精度の維持について、実プロダクト環境での検証が進められる見通し。