🧠Research🔥🔥

Meta、リアルタイム音声認識モデル Muse Voice Transcribe を公開──3.1% の WER を記録

ASR・話者分離・エンドポイント検出を単一の自己回帰 LLM に統合し、Artificial Analysis ベンチマークで首位を獲得した。
リリース: 2026-09-01 · 読了 3

記事の要約

1. 核心(What)

  • Meta Superintelligence Labs は ASR、話者分離、エンドポイント検出を統合した Muse Voice Transcribe をリリースした。
  • Artificial Analysis の AA-WER ストリーミングベンチマークで 3.1% の WER を記録し、上位競合モデルを抑えて首位となった。
  • Meta Model API 経由で提供され、価格は 1,000 オーディオ分あたり 3 ドルに設定されている。
  • 70 以上の言語、20 人以上の同時話者、1 時間超の長尺音声、ネイティブなコードスイッチングに対応する。

2. 影響(Why)

  • 音声パイプラインの単一 LLM 統合: これまで別個に構築していた ASR や VAD を一つの自己回帰モデルで処理するため、システム設計と運用オーバーヘッドが大幅に軽減される。
  • コストと精度の新たな水準: 他社競合 API を下回る低価格でありながら SOTA 級の精度を達成しているため、商用音声サービスの利益率が改善する。

3. 根拠・詳細(How)

  • 80ms 単位の音声チャンク処理: 音声を 12.5 Hz(80ms 毎)でチャンク化し、各チャンクを 1 つのソフトトークンに圧縮してテキストまたは次回の音声継続トークンを出力する。
  • 強化学習による適応的遅延: 単語誤り率の報酬と遅延の報酬を乗法的に組み合わせた強化学習により、あいまいな単語では待ち時間を延ばし、明確な部分では即座に出力するポリシーを獲得している。

4. 展望・課題(Next)

  • オープンウェイト非公開の制約: オープンウェイト版の提供予定は現在のところロードマップになく、オンプレミス環境やファインチューニングでの利用は制限される。