FastVideo、動画生成モデル FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree を公開──4 回の Transformer 前方演算で同期オーディオ生成
MiniMax H3 ベースのモデルをデータフリー DMD2 と 90% sparsity の VSA-H3 で蒸留し、4 ステップのテキスト・オーディオ同時生成を実現した。
リリース: 2024-05-23 · 読了 3 分記事の要約
1. 核心(What)
- FastVideo は 4 ステップのテキスト・オーディオ同時生成を行う FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree チェックポイントを公開した
- ステップ 1300 のモデルはデータフリー DMD2 と 90% sparsity の VSA-H3 を用いて蒸留されている
- CUDA 13 および Blackwell 世代向けのカスタムカーネルホイールのインストール手順と実行スクリプトが提供されている
- テスト済みのデフォルト環境では 4 基の B200 GPU を使用し、GPU 数は H3 の 56 アテンションヘッドを割り切る必要がある
2. 影響(Why)
- 4 ステップによる動画生成の高速化: 4 回の Transformer 前方演算でオーディオ付き動画を出力できるため、商用ワークフローでの推論レイテンシを大幅に短縮できる。
- 国内動画生成 SaaS への影響: [国内 動画生成 SaaS 業種] のような中規模事業者は、B200 などの最新 GPU クラスタを活用したリアルタイム性の高い動画・音声同期パイプラインの検証コストを低減できる。
3. 根拠・詳細(How)
- VSA-H3 アテンションバックエンドとカーネルの導入: Python 3.12 環境下で uv を用いてインストールし、UV_TORCH_BACKEND=cu130 を指定して fastvideo-kernel の事前ビルド済みホイールを導入する。
- マルチ GPU 実行時の制約と設定: 56 アテンションヘッドを持つ H3 アーキテクチャに合わせて GPU 数を調整し、必要に応じて --no-replicated-dit や --vsa-kernel triton を指定して実行する。
4. 展望・課題(Next)
- Omni Ref を見据えた今後の展開: FL2VA や Ref2VA の蒸留は未完了であり、今後は Omni Ref の統合に向けて実世界クリエイティブエージェントのワークロードに合わせた調整が進められる。