📜Papers🔥🔥

映像と音声を同時に生成する基盤モデル Kandinsky 6.0 Video──3B/29B の 2 モデルを公開

テキストや画像から 5 秒間の Full-HD 映像と同期した 44 kHz 音声を生成するデュアルストリーム CrossDiT モデルを提案し、人間評価で優れた音声品質を実証した。
リリース: 2026-10-04 · 読了 4 分

論文概要

Team Kandinskyらは、テキストおよび画像から同期した映像と音声を同時に生成する基盤拡散モデルのファミリ「Kandinsky 6.0 Video」を公開した。本モデル群は、3000億パラメータ規模のLite版(3B)とPro版(29B)で構成されており、5秒間のビデオクリップを高精度なリップシンクを含む44 kHz音声とともに生成する。さらに、内蔵の超解像モデルにより出力解像度をFull-HD(1920×1080)まで引き上げる機能を持つ。

関連研究

Kandinsky 5.0などの従来型ビデオ生成モデルは、映像単体の生成や後付けの音声合成に依存することが多く、映像と音声のフレーム単位での時間的・意味的な整合性をネイティブに処理するアーキテクチャが不足していた。本研究は、事前学習済みのビデオストリームと新規のオーディオストリームを双方向のクロスアテンションで結合する方式を採用し、この課題を克服している。

新規性と貢献

最大の新規性は、双方向のクロスアテンションを介して映像と音声を直接同期・生成する「デュアルストリーム CrossDiT アーキテクチャ」の導入にある。事前学習済みの映像ストリームの表現力を維持しつつ、大規模音声コーパスでゼロから学習したオーディオストリームを統合することで、モデル間の干渉を防ぎながらマルチモーダルな整合性を確保している点に学術的・実用的な貢献がある。

提案手法の詳細

Kandinsky 6.0 Videoは、Kandinsky 5.0のビデオ生成能力を基盤とし、デュアルストリーム CrossDiT構造を採用している。連続事前学習戦略として、まずオーディオストリームを大規模音声データで単体学習させた後、両ストリームをペアの音声-映像データで結合学習(ジョイントトレーニング)させる。その後、教師あり微調整(SFT)、強化学習ベースの後学習、および蒸留を行い、推論効率の向上と品質の安定化を図っている。

評価・考察

サイドバイサイドの人間評価において、Kandinsky 6.0 Video Proは前世代モデルであるKandinsky 5.0 Video Proを明確に上回る性能を示した。特に音声の品質や、唇の動きと音声の同期(リップシンク)において、既存の主要なオーディオビデオ生成モデルと十分に競合する水準に達していることが確認されている。

応用例と今後の展望

本手法はオープンソース(MITライセンス)としてコード、モデルチェックポイント、diffusers統合が公開されており、国内のエンターテインメント・映像制作業(アニメーション制作やゲーム開発など、月産数百カット以上の動画アセットを扱う規模)において、音声付きプロトタイプ映像の自動生成や効率化のワークフローに直接組み込むことが可能である。今後の課題としては、生成時間のさらなる短縮や、5秒を超える長尺動画への安定したコンテキスト拡張が挙げられる。

結論

Kandinsky 6.0 Videoは、映像と音声をネイティブに同期生成するスケーラブルな基盤モデル群であり、デュアルストリーム CrossDiTによるアプローチの有効性を実証した。オープンな公開により、今後のマルチメディア生成分野の研究開発を加速させる重要なマイルストーンとなる。

注釈

  • CrossDiT: 拡散モデル(Diffusion Transformer)のアーキテクチャに対し、クロスアテンション機構を用いて複数のモダリティ間を接続する設計手法。