📜Papers🔥🔥

14B パラメータ Diffusion Transformer によるリアルタイム長文脈人間アニメーション手法 LiveAnimate──2基の NVIDIA H100 で 19.63 FPS を実証

参照画像と駆動ポーズから 14B パラメータの DiT を用いて安定した長文脈アニメーションをリアルタイム生成する手法であり、PR-Sink 機構によりメモリと遅延を一定に保ちながら 19.63 FPS を実現した。
リリース: 2026-08-12 · 読了 5

論文概要

ポーズ駆動型の人体アニメーション生成において、単一の参照画像と駆動ポーズのストリームから高品質な動画をリアルタイムで合成する手法「LiveAnimate」が提案された。140億パラメータ(14B)のビデオ Diffusion Transformer(DiT)をベースに構築されており、リアルタイムのストリーミング処理と、数十分に及ぶ安定した長文脈生成を両立している。2基の NVIDIA H100 GPU を用いた環境下で 19.63 FPS のストリーミング推論を達成し、3分間の長尺ベンチマークにおいても初期フレームと同等の知覚品質と人物アイデンティティを維持する。

Figure 1: LiveAnimateの全体フレームワークを示す図であり、参照画像とストリーミングポーズ信号からビデオブロックを自己回帰的に生成するパイプラインを表しています。

関連研究

従来の手法では、拡散モデルを用いた人体アニメーション生成において 1 クリップあたり数分から数時間の計算時間を要するため、ライブストリーミングやテレプレゼンスといった対話的なインタラクティブアプリケーションへの適用が困難であった。また、長時間のストリーミング処理を行うと時間経過に伴うアイデンティティの崩壊や品質劣化が蓄積するという課題が存在していた。

新規性と貢献

本研究の主要な貢献は、14B パラメータ規模の大規模 DiT を用いたリアルタイム・長文脈アニメーションシステムを世界で初めて実現した点にある。二段階の訓練パイプラインの導入によりサンプリングステップ数を劇的に削減し、さらに新しい KV キャッシュ機構である PR-Sink を導入することで、ストリームの長さに依存せず一定のメモリ消費と処理遅延を実現した。

提案手法の詳細

LiveAnimate は双方向の事前学習済み DiT をブロック因果的自己回帰ジェネレータへ適応させる「Reference-Anchored Teacher-Forcing Adaptation」と、サンプリングバジェットを 3 ステップまで削減する「Block-wise Self-Forcing Distillation」の二段階訓練パイプラインを採用している。

Figure 2: 3分間のロールアウトにおける品質とアイデンティティの推移を示したグラフであり、蓄積劣化に対する耐性を評価しています。

さらに、長尺生成時に外観やアイデンティティを維持するため、Pose-Retrieval Sink Attention(PR-Sink)と呼ばれる有界 KV キャッシュ機構を導入した。これは最初の生成ブロックを恒久的に固定する Static Sink、ポーズによって過去の履歴ブロックを呼び出す Dynamic Sink、および 3 スロットの Rolling Window を組み合わせたものであり、シーケンス全体を保持し続けることなく過去の外観コンテキストを効率的に復元する。

評価・考察

評価実験において、本手法は Ulysses シーケンス並列性と演算子融合(operator fusion)を組み合わせることで、2基の NVIDIA H100 GPU で 19.63 FPS のストリーミング推論速度を達成した。3分間のテストベンチマークのロールアウトにおいて、初期の 30 秒から最後の 1 分間に至るまで知覚品質と人物アイデンティティがほぼ一定に保たれていることが実証されており、従来システムで見られた著しい品質劣化が大幅に抑制されている。

Figure 3: 同一の参照画像と駆動ポーズシーケンスを用いた、3分間のロールアウトにおける各アブレーション手法の定性的な比較結果です。

応用例と今後の展望

本手法はライブ配信、遠隔プレゼンス(テレプレゼンス)、仮想アバターを用いたリアルタイム対話システムへの直接的な応用が可能である。日本のエンターテインメント業界やバーチャルライブ配信サービス等において、ユーザーの動作に遅延なく追従する高精細な 3D/2D アバター制御システムの実装コストを大きく引き下げる実務インパクトを持つ。今後は、より多様な照明条件や複雑な衣装に対するロバスト性の検証が課題となる。

結論

14B パラメータの Diffusion Transformer をベースにした LiveAnimate は、二段階の訓練戦略と PR-Sink 注意機構の導入により、リアルタイム処理と長文脈の安定性を同時に満たす人体アニメーション生成の新しい動作点(オペレーティングポイント)を確立した。

注釈

  • Diffusion Transformer (DiT): 従来の U-Net に代わり Transformer アーキテクチャを拡散モデルのバックボーンとして採用したモデル。
  • KV キャッシュ: 自己回帰モデルの生成時に過去のキー・バリューテンソルを保持し、再計算を避けることで高速化を図る仕組み。