🧠Research🔥

FastVideo、動画生成モデル FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree を公開──4 回の Transformer 前方演算で同期オーディオ生成

MiniMax H3 ベースのモデルをデータフリー DMD2 と 90% sparsity の VSA-H3 で蒸留し、4 ステップのテキスト・オーディオ同時生成を実現した。
リリース: 2024-05-23 · 読了 3

記事の要約

1. 核心(What)

  • FastVideo は 4 ステップのテキスト・オーディオ同時生成を行う FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree チェックポイントを公開した
  • ステップ 1300 のモデルはデータフリー DMD2 と 90% sparsity の VSA-H3 を用いて蒸留されている
  • CUDA 13 および Blackwell 世代向けのカスタムカーネルホイールのインストール手順と実行スクリプトが提供されている
  • テスト済みのデフォルト環境では 4 基の B200 GPU を使用し、GPU 数は H3 の 56 アテンションヘッドを割り切る必要がある

2. 影響(Why)

  • 4 ステップによる動画生成の高速化: 4 回の Transformer 前方演算でオーディオ付き動画を出力できるため、商用ワークフローでの推論レイテンシを大幅に短縮できる。
  • 国内動画生成 SaaS への影響: [国内 動画生成 SaaS 業種] のような中規模事業者は、B200 などの最新 GPU クラスタを活用したリアルタイム性の高い動画・音声同期パイプラインの検証コストを低減できる。

3. 根拠・詳細(How)

  • VSA-H3 アテンションバックエンドとカーネルの導入: Python 3.12 環境下で uv を用いてインストールし、UV_TORCH_BACKEND=cu130 を指定して fastvideo-kernel の事前ビルド済みホイールを導入する。
  • マルチ GPU 実行時の制約と設定: 56 アテンションヘッドを持つ H3 アーキテクチャに合わせて GPU 数を調整し、必要に応じて --no-replicated-dit や --vsa-kernel triton を指定して実行する。

4. 展望・課題(Next)

  • Omni Ref を見据えた今後の展開: FL2VA や Ref2VA の蒸留は未完了であり、今後は Omni Ref の統合に向けて実世界クリエイティブエージェントのワークロードに合わせた調整が進められる。