🛠Tools🔥🔥

Alibaba、音声 API プラットフォーム Qwen-Audio 3.1 を公開──API 料金を最大 95% 削減

ASR、TTS、リアルタイム対話を網羅する 5 つのモデル群を展開し、音声認識の API 料金を最大 95%、リアルタイム対話を 85% 削減した。
リリース: 2026-09-23 · 読了 3

記事の要約

1. 核心(What)

  • Alibaba は音声処理モデル群 Qwen-Audio 3.1 を Alibaba Cloud Model Studio で公開した
  • ASR-Next は話者ダイアライゼーション、タイムスタンプ、感情、環境音の認識機能を追加した
  • TTS-Next は言語モデルと拡散モデルを組み合わせて音声と音響効果を 1 パスで生成する
  • Qwen-Audio 3.1 Realtime Plus は 262K トークンのコンテキストを処理し、音声クローンや関数呼び出しに対応する

2. 影響(Why)

  • パイプラインの統合による実装効率化: 従来の音声エージェントで必要だった個別サービス間のハンドオフを削減し、レイテンシとシステム構築コストを抑制できる。
  • 国内音声 SaaS のコスト構造への影響: API 料金が最大 95% 削減されるため、国内の音声対話システムや文字起こしサービスの利益率構造を大きく塗り替える可能性がある。

3. 根拠・詳細(How)

  • 低フレームレートトークナイザーによる予測効率化: Qwen-Audio 3.1 TTS は低フレームレートの音声トークナイザーにより 1 秒あたり 12.5 フレームで音声を表現し、自己回帰型言語モデルが予測すべき単位数を削減する。
  • 5 段階の段階的強化学習プロセス: 言語モデルとフローマッチングモデルの個別事前学習、高品質データへの集中学習、そして各コンポーネントへの強化学習を順次適用して韻律や音声類似度を向上させる。

4. 展望・課題(Next)

  • ASR-Next および TTS-Next の API 提供: Alibaba は ASR-Next および TTS-Next の具体的な API 公開日を現時点で発表していない。