Suno、音声生成機能 Speech を公開──BGM 付き音声トラックを単一モデルで同時生成
Suno の既存 Web およびモバイルプラットフォームでパブリックベータとして提供され、最長 8 分の音声と背景音楽を統合生成できる。
リリース: 2026-10-02 · 読了 2 分記事の要約
1. 核心(What)
- Suno は AI 音楽生成プラットフォームに、音声生成機能「Speech」を追加した。
- Web およびモバイルプラットフォーム上の「Create」タブから利用できるパブリックベータとして提供される。
- プロンプトによる指示で生成する「Simple」モードと、カスタムスクリプトを入力する「Advanced」モードの 2 つを搭載する。
2. 影響(Why)
- 音声と音楽の同時統合生成: 単なるテキスト読み上げではなく、背景音楽と音声を 1 つのモデルで同時に出力するため、BGM 合わせの編集コストが不要になる。
- 国内クリエイターの制作効率化: [国内 音声コンテンツ制作・映像制作業種] の現場では、ナレーションと BGM のミキシング作業を自動化し、コンテンツの試作サイクルを加速できる。
3. 根拠・詳細(How)
- 2 種類の入力モードと制御設定: プロンプト記述による簡易生成の Simple モードと、カスタムスクリプトで発話内容を制御する Advanced モードを備え、声の性別やスタイルを調整可能。
- 最大 8 分の生成上限とベータ仕様: 最大で約 8 分までの連続生成に対応し、ベータ版の段階としてアクセントの揺らぎや過剰な休止などの不確実性が許容されている。
4. 展望・課題(Next)
- ユーザーフィードバックに基づく改良: 最高製品責任者の Jack Brody 氏によれば、今後の正式版に向けてユーザーからのフィードバックを基に品質改善と機能拡張を継続する予定。