Fish Audio、音声認識モデル transcribe-1-pro を公開──話者分離と感情タグを 0.36 ドル/時間で統合
Fish Audio が ASR API に話者 diarization と感情・笑い声をインライン挿入する transcribe-1-pro を追加し、コスト据え置きで 1 パス処理を実現した。
リリース: 2026-09-28 · 読了 3 分記事の要約
1. 核心(What)
- Fish Audio は transcribe-1-pro を発表し、音声認識と同時に話者分離や感情・ボーカルイベントの検出を 1 パスで提供する。
- 価格は 1 音声時間あたり 0.36 ドルであり、秒単位の従量課金でトークン数やリクエスト数に依存しない。
- 出力形式はインラインの <|speaker:N|> マーカーとブラケット形式の感情タグを含む単一文字列となっている。
- 対応言語は 83 言語で、自動言語検出およびワードレベルのタイムスタンプ機能をサポートする。
2. 影響(Why)
- 複数ステージ統合によるコスト削減: 文字起こし、話者分離、感情分類を別個に実行してマージしていた従来構成を 1 パスにまとめられるため、音声処理パイプライン全体の運用複雑性を低減できる。
- 国内コールセンター分析への適用: 国内のコンタクトセンター向け音声解析システム開発企業は、顧客の感情や相槌のデータを追加コストなしで会話ログに組み込み、LLM のスコアリング精度を高められる。
3. 根拠・詳細(How)
- HTTP ヘッダーによるモデル選択: POST /v1/asr エンドポイントに対して model: transcribe-1-pro ヘッダーを付与することで、既存の認証やマルチパートフォームデータの送信構造を変更せずに有効化できる。
- 正規表現による話者ターンパース: レスポンスの text フィールドに含まれる <|speaker:(\d+)\|> マーカーを正規表現で抽出し、ダウンストリームの処理で話者ごとのオブジェクトに分割する。
4. 展望・課題(Next)
- Web アプリケーション対応の予定: 現在は API のみでの提供となっているが、今後は Web アプリケーションからの利用も順次サポートされる計画である。