🧠Research🔥🔥

Fish Audio、音声認識モデル transcribe-1-pro を公開──話者分離と感情タグを 0.36 ドル/時間で統合

Fish Audio が ASR API に話者 diarization と感情・笑い声をインライン挿入する transcribe-1-pro を追加し、コスト据え置きで 1 パス処理を実現した。
リリース: 2026-09-28 · 読了 3 分

記事の要約

1. 核心(What)

  • Fish Audio は transcribe-1-pro を発表し、音声認識と同時に話者分離や感情・ボーカルイベントの検出を 1 パスで提供する。
  • 価格は 1 音声時間あたり 0.36 ドルであり、秒単位の従量課金でトークン数やリクエスト数に依存しない。
  • 出力形式はインラインの <|speaker:N|> マーカーとブラケット形式の感情タグを含む単一文字列となっている。
  • 対応言語は 83 言語で、自動言語検出およびワードレベルのタイムスタンプ機能をサポートする。

2. 影響(Why)

  • 複数ステージ統合によるコスト削減: 文字起こし、話者分離、感情分類を別個に実行してマージしていた従来構成を 1 パスにまとめられるため、音声処理パイプライン全体の運用複雑性を低減できる。
  • 国内コールセンター分析への適用: 国内のコンタクトセンター向け音声解析システム開発企業は、顧客の感情や相槌のデータを追加コストなしで会話ログに組み込み、LLM のスコアリング精度を高められる。

3. 根拠・詳細(How)

  • HTTP ヘッダーによるモデル選択: POST /v1/asr エンドポイントに対して model: transcribe-1-pro ヘッダーを付与することで、既存の認証やマルチパートフォームデータの送信構造を変更せずに有効化できる。
  • 正規表現による話者ターンパース: レスポンスの text フィールドに含まれる <|speaker:(\d+)\|> マーカーを正規表現で抽出し、ダウンストリームの処理で話者ごとのオブジェクトに分割する。

4. 展望・課題(Next)

  • Web アプリケーション対応の予定: 現在は API のみでの提供となっているが、今後は Web アプリケーションからの利用も順次サポートされる計画である。