推論サーバー vLLM-Omni DLC を公開──Amazon SageMaker AI でリアルタイム音声合成ストリーミングを実現
Amazon SageMaker AI 上で vLLM-Omni DLC を用いて Qwen3-TTS をデプロイし、テキスト入力から 24 kHz 音声チャンクを双方向 WebSocket でストリーミング出力する実装手順を公開した。
リリース: 2026-09-28 · 読了 3 分記事の要約
1. 核心(What)
- AWS は vLLM-Omni Deep Learning Container を Amazon SageMaker AI に統合し、リアルタイム音声合成を実現するチュートリアルを公開した。
- Qwen3-TTS モデルを用い、v1/audio/speech/stream エンドポイントを介してテキスト入力から音声チャンクへの双方向ストリーミングを行う。
- SageMaker Runtime の HTTP/2 フルデュプレックス WebSocket を利用し、ポート 8443 を通じてコンテナ内のルーティングミドルウェアへ接続する。
- インスタンスプール設定により、ml.g6.xlarge をプライマリとし、ml.g6e.xlarge や ml.g5.xlarge などをフォールバック先として指定できる。
2. 影響(Why)
- 体感レイテンシの劇的な短縮: 全テキストの生成完了を待たずに最初の音声チャンクを再生できるため、音声対話エージェントにおける無音の待ち時間を削り、対話のレスポンス向上に直結する。
- マネージド環境での実装負担軽減: [国内 音声対話 SaaS 業種] のようにリアルタイム性を重視する開発チームは、コンテナイメージとルーティング設定がパッケージ化された AWS DLC を用いることで、インフラ構築の工数を大きく削減できる。
3. 根拠・詳細(How)
- WebSocket による双方向ストリーミング接続: SageMaker Runtime の HTTP/2 フルデュプレックス WebSocket を経由してクライアントとコンテナ間を接続し、v1/audio/speech/stream ルートで音声チャンクをリアルタイムにやり取りする。
- インスタンスプールによる可用性制御: ml.g6.xlarge を最優先としつつ、容量枯渇時に ml.g6e.xlarge や ml.g5.xlarge へ自動フォールバックするプライオリティ付きインスタンスプール構成を採用している。
4. 展望・課題(Next)
- 画像・動画生成への展開: 本シリーズの Part 2 では、vLLM-Omni DLC を画像および動画生成ワークフローへ適用する手順が公開される予定である。