Pika Labs、音声合成モデル Pika Speech を公開──ElevenLabs 比 9 倍安のコストと RTF 0.02 を実現
3B パラメータのフローマッチング TTS により、48 kHz のスタジオ品質音声を $0.01/分で生成可能にする。
リリース: 2026-08-21 · 読了 3 分記事の要約
1. 核心(What)
- Pika Labs は 3B パラメータのフローマッチング TTS モデル Pika Speech を発表した。
- 1 分の音声生成にかかる時間を表す RTF は 0.02 であり、API 価格は $0.01/分に設定されている。
- 40 万 3,000 時間の音声データで学習され、英語と中国語の音声合成に対応する。
- FlashAttention-3 や CUDA グラフなどを活用した独自の最適化サーバーにより高速推論を実現している。
2. 影響(Why)
- コスト構造の劇的な改善: 主要な商用 API と比較して最大 9 倍安価な価格設定により、音声生成を組み込んだサービスの利益率を大幅に引き上げられる。
- 国内音声エージェントへの波及: 国内のコンタクトセンター向けシステム開発企業は、従量課金のボトルネックを解消できるため、リアルタイム音声対話の導入障壁が低下する。
3. 根拠・詳細(How)
- モデルアーキテクチャと蒸留: 3B パラメータの拡散トランスフォーマーをベースとし、DMD(Distribution Matching Distillation)を用いることで 8 ステップ以下のデノイズ処理を実現。
- EOS ラテンティップによる持続時間制御: モデル内部の EOS ラレントを制御することで、後処理のタイムストレッチなしに発話速度と長さを直接調節できる。
4. 展望・課題(Next)
- PikaStream 2.0 への統合: リアルタイム動画生成モデル PikaStream 2.0 の同期音声バックエンドとして統合され、インタラクティブアバターの構築に展開される予定。