📜Papers🔥🔥

SANA-Video 2.0: ハイブリッド線形アテンションによる高効率動画生成モデル──単一 H100 で 720p 生成を 13.06 秒で達成

線形アテンションと周期的なソフトマックスを組み合わせた Hybrid Linear-Softmax Attention により、既存の大規模ソフトマックス DiT と同等の品質を維持しつつ推論速度を大幅に向上させた。
リリース: 2026-07-23 · 読了 5

論文概要

SANA-Video 2.0 は、5B および 14B スケールで構築されたハイブリッド型の動画拡散トランスフォーマー(DiT)である。単一の GPU で最大 720p の高品質な動画を生成しつつ、フルソフトマックスの動画 DiT と同等の品質を維持し、線形アテンションによる長シーケンスのスケーラビリティを両立している。40 ステップのサンプリングにより、単一の H100 GPU 上で 480p の動画生成を 13.2 秒で行い、VBench スコア 84.30 を達成している。

関連研究

従来の動画生成モデル(例: Wan 2.2-A14B など)は、フルソフトマックスアテンションを採用しているため計算量がシーケンス長に対して二乗で増加するという課題があった。純粋な線形アテンションは計算量を O(N)O(N) に削減できる一方で、表現力が低下するというトレードオフが存在した。本研究では、事前学習済みモデルの線形化ではなく、最初からハイブリッド構造として直接学習を行うことでこの課題を克服している。

新規性と貢献

本研究の主要な貢献は、計算効率と表現力のバランスを取る「Hybrid Linear-Softmax Attention」および「Block Attention Residuals (AttnRes)」の提案である。これにより、フルソフトマックスモデルと比較してコンパイル済みの DiT フォワードパスが 720p/60s で 3.2 倍高速化し、さらに Sol-Engine による最適化を組み合わせることで、同等サイズの従来モデルに対して圧倒的な高速化を実現している。

提案手法の詳細

提案手法の核心は以下の 2 つの要素から構成される。

  • Hybrid Linear-Softmax Attention: ゲート付き線形アテンション(O(N)O(N) のミキシング)と、3:1 の比率で配置された周期的なゲート付きソフトマックスアンカーを組み合わせることで、純粋な線形アテンションで欠落していたフルランクのトークン相互作用を復元する。
  • Block Attention Residuals (AttnRes): 完了したブロックの要約を後続の線形層にルーティングし、アンカー特徴量の再利用と深層レイヤーの有効ランクの約 12% 向上を実現する。

評価・考察

評価では、40 ステップサンプリングを用いた 480p 動画生成において VBench スコア 84.30 を記録した。また、Sol-Engine によるハードウェア最適化(カーネル融合、キャッシング、スパースアテンション)により、5B パイプラインは 720p/5s の生成を 13.06 秒で完了し、Wan 2.2-A14B と比較して 120 倍高速であることが示されている。プロキシ調査により、25% のソフトマックス比率が品質と効率の最適なトレードオフであることが確認されている。

応用例と今後の展望

実務インパクトとして、国内のエンターテインメント・映像制作業や広告業界において、高解像度動画の試作やリアルタイムに近い動画生成パイプラインの構築コストを大幅に引き下げる可能性がある。特にエッジや単一 GPU 環境での推論コスト削減が求められる現場において、実用的な選択肢を提供する。今後の課題としては、より長時間の動画生成における一貫性の維持や、多様なドメインへの適応が挙げられる。

結論

SANA-Video 2.0 は、線形アテンションとソフトマックスのハイブリッド設計により、大規模動画生成における計算コストの壁を突破した。品質を損なわずに推論速度を劇的に改善するアプローチとして、今後の動画生成モデルの設計に大きな影響を与えることが期待される。

注釈

  • DiT (Diffusion Transformer): 拡散モデルのバックボーンとして Transformer アーキテクチャを採用したモデル。
  • VBench: 動画生成モデルの総合的な品質を評価するためのベンチマークスイート。