Kyutai、音声対話モデル Voice of Reason を公開──GSM8K で 77.1% の数学推論精度を達成
音声再生中の隙間時間を計算リソースに利用する STITCH 手法により、従来の逐次パイプラインで発生していた長大な初期レイテンシを回避しつつ推論能力を向上させた。
リリース: 2026-09-21 · 読了 3 分記事の要約
1. 核心(What)
- Kyutai は音声入力から音声出力までを直接処理し、数学問題の推論を声に出しながら行う音声対話モデル Voice of Reason を発表した。
- GSM8K ベンチマークにおいて、STITCH 変種を用いた構成では 77.1%、ダイレクト回答構成では 70.3% の正答率を記録した。
- GLM-4-Voice-9B をベースに、非公開の推論セグメントを含む対話データを用いた教師あり微調整(SFT)とバイナリ LLM 判定器を用いた強化学習で訓練されている。
- 音声再生にかかる時間を利用して次の音声セグメントの隠れ推論トークンを生成し、処理の遅延を追加することなく推論能力を付与する STITCH 手法を導入している。
2. 影響(Why)
- 音声対話の遅延と推論の両立: 従来の ASR・テキスト LLM・TTS を直列に繋ぐパイプライン構造では応答遅延が避けられなかったが、音声再生のウィンドウ内で思考を終わらせる設計により、リアルタイム性を維持したまま高度な推論タスクを処理できる。
- 国内の音声対話 SaaS 開発への影響: 国内の音声アシスタントや教育系アプリ開発を手がける中堅規模の事業者にとって、外部のテキスト LLM を挟む複雑なアーキテクチャを廃し、単一の H100 サーバー環境で低遅延の推論型音声ボットを構築する現実的な選択肢が増える。
3. 根拠・詳細(How)
- STITCH 機構による隠れ推論: 音声データの再生時間が背後のトークン生成時間より長い点に着目し、[SOPR] と [EOPR] マーカーで囲まれた非公開の推論トークンを生成しながら、13 テキストトークンと 26 オーディオトークンのスケジュールで音声セグメントを交互に出力する。
- 訓練プロセスと必要コンポーネント: 訓練は正解判定にバイナリ LLM 判定器を用いた強化学習を採用。推論時は Voice of Reason チェックポイントに加え、Whisper ベースの音声トークナイザーと音声を波形に変換する GLM-4-Voice デコーダーを組み合わせて動作させる。
4. 展望・課題(Next)
- 対応ドメインの拡張と評価: 現在の評価は GSM8K の算数問題に限定されており、オープンエンドな会話や多言語対応、雑音環境下での性能検証は今後の課題となる。