🧠Research🔥🔥

VieNeu-TTS、音声合成モデル VieNeu-TTS v3 Turbo を公開──48 kHz ベトナム語音声の CPU 実行と OpenAI 互換 API を実現

約1万時間の音声データでゼロから学習した100Mパラメータのオープンソースモデルで、CPU単体での高速な音声合成と16多重のストリーミング出力を両立した。
リリース: 2026-10-03 · 読了 3 分

記事の要約

1. 核心(What)

  • VieNeu-TTS v3 Turbo は 48 kHz の高音質なベトナム語音声合成に対応し、Apache-2.0 ライセンスで公開された。
  • 北部・中部・南部の方言を含む 23 種類のプリセットボイスと、インスタント音声クローン機能を搭載している。
  • /v1/audio/speech エンドポイントを備え、Pipecat や LiveKit、OpenAI SDK のクライアントへそのまま組み込める。
  • CPU 推論時は ONNX Runtime を用いて torch-free で動作し、GPU 推論時は PyTorch とバッチ処理へ自動切り替えを行う。

2. 影響(Why)

  • ローカル環境における音声パイプラインの構築コスト削減: 商用 API に依存せず、安価な CPU や単一の低価格 GPU で 48 kHz の高品質な音声合成を内製できるため、コンタクトセンターなどの音声対話システムのインフラ費用を大幅に圧縮できる。
  • 国内の多言語音声対話 SaaS 開発における選択肢: ベトナムなどの海外展開を視野に入れる国内の音声系スタートアップは、標準的な OpenAI 互換 API をそのまま流用して低レイテンシな多言語エージェントをローカル検証する基盤として導入検討に値する。

3. 根拠・詳細(How)

  • MOSS Audio Tokenizer による 48 kHz 音声コーデック: v2 シリーズの 24 kHz から倍増した 48 kHz の出力レートを実現するため、MOSS Audio Tokenizer ニューラルコーデックを採用し、豊かな音響表現を可能にしている。
  • ONNX Runtime と PyTorch のデュアルバックエンド設計: CPU パスでは PyTorch 依存を排除して ONNX Runtime で軽量に動作させ、CUDA 環境では継続的バッチ処理スケジューラを備えた PyTorch エンジンへ自動スイッチする設計。

4. 展望・課題(Next)

  • コードスイッチングと感情表現の検証: 英語とベトナム語の混在(コードスイッチング)やインラインの感情制御タグが、実際のプロダクション環境の対話シナリオでどの程度ロバストに動作するか実証実験が必要。