🧠Research🔥🔥

OpenAI、音声対話モデル GPT-Live-1 を API で公開──Full Duplex ベンチで 30 ポイント向上

音声ストリームを直接処理する全二重アーキテクチャにより、従来の STT・LLM・TTS のパイプライン構成を廃止し、実装コードを最大 80% 削減する。
リリース: 2026-09-10 · 読了 3

記事の要約

1. 核心(What)

  • OpenAI は API 向けに全二重音声モデル GPT-Live-1 を公開し、音声レイヤーの価格を 1 分あたり $0.05 に設定した。
  • Full Duplex Bench において GPT-Realtime-2.1 を 30 ポイント上回り、Tau3 ベンチマークで 1 位を獲得した。
  • 音声処理とバックエンドの推論を分離する委譲パターンを採用し、任意のバックエンドモデルやツールと連携できる。
  • 早期導入事例として、ある医療関連企業がカスタムパイプラインからの移行によりコード量を 23,000 行(80%)削減した。

2. 影響(Why)

  • パイプライン実装コストの激減: 従来の cascaded パイプラインで自作していた音声割り込み処理やレイテンシ対策のコードを丸ごと削除できるため、電話連携アプリの開発生産性が一気に跳ね上がる。
  • 国内受託開発への波及効果: [国内 電話・IVR 開発を手がける受託開発事業者] のような規模の組織は、顧客向けの音声ボット受託開発において従来の STT-LLM-TTS 統合の工数を大幅に圧縮できる。

3. 根拠・詳細(How)

  • 全二重ストリーミング処理とバックエンド委譲: 音声の入力と出力を同時に処理する単一の音声レイヤーを採用し、推論やツール呼び出しは GPT-6 Astra などのバックエンドモデルに非同期で委譲する構成をとる。
  • 提供仕様とエコシステム: 12 種類の音声バリエーション、テレフォニーサポート、キーワードバイアス機能を標準搭載し、API ドキュメントおよびコード編集リポジトリとのリファレンス連携が公開されている。

4. 展望・課題(Next)

  • カスタム音声の展開: カスタムボイスの利用には営業窓口を通した手続きが必要となっており、多言語対応の拡充が今後の数ヶ月で予定されている。