Sarvam AI、感情音声対応モデル Bulbul V4 を公開──11 種類のインド言語と 39 以上のボイスをサポート
LLM ベースのプロソディエンジンによりイントネーションや感情表現を最適化し、ElevenLabs を超える自然な音声合成を実装した。
リリース: 2026-07-30 · 読了 3 分記事の要約
1. 核心(What)
- Sarvam AI が最新のインド言語向けテキスト読み上げモデル Bulbul V4 を公開した。
- ヒンディー語、タミル語、テルグ語、ベンガル語を含む 11 種類の言語をサポートしている。
- LLM ベースのプロソディエンジンを採用し、音声の抑揚や感情表現を文脈に応じて最適化する。
- 音声エージェントや BFSI 向けコールセンターでの導入を想定した REST および WebSocket API を公開している。
2. 影響(Why)
- 多言語ボイスエージェントの構築効率: グローバル大手 LLM では対応が難しい地域言語やコードスイッチングをネイティブに処理できるため、インド市場向け音声サービスの開発コストを大幅に抑制できる。
- 国内マルチリンガル SaaS への示唆: 多言語対応のコールセンターを展開する国内 BPO やインバウンド向け SaaS 業種は、英語以外のローカル言語における音声合成の精度基準を再定義する動向として注視すべきである。
3. 根拠・詳細(How)
- LLM ベースのプロソディ推論機構: 入力テキストを単なる逐次シーケンスとして処理せず、LLM が文脈から強調、ポーズ、トーン、ペーシングを推論し、自然なイントネーションの音声波形を生成する。
- 低遅延ストリーミング実装: WebSocket API を介したストリーミング処理により、応答遅延 250ms 未満のリアルタイム音声対話を音声エージェントや IVR システムで実現する。
4. 展望・課題(Next)
- 対応言語と音声バリエーションの拡張: 11 以外のインド地方言語への対応拡大や、さらに多様な感情表現を持つボイスモデルの追加が予定されている。