Lightricks、動画生成モデル LTX-2.5 を公開──マルチショット生成とカスタム Gemma 4 12B テキストエンコーダーを搭載
キャラクターや照明の連続性を保持したマルチショット生成やカスタム Gemma 4 12B テキストエンコーダーを搭載し、ローカル環境での高精度な動画・音声生成を実現する。
リリース: 2026-01-06 · 読了 3 分記事の要約
1. 核心(What)
- Lightricks社が公開した LTX-2.5 は、テキスト、画像、動画入力を基に同期した動画と音声を生成するオープンウェイトモデルである。
- キャラクターや環境、照明、音声、ビジュアルスタイルをカット間で維持するネイティブなマルチショット生成機能を備える。
- カスタム Gemma 4 12B テキストエンコーダーや新開発の拡散動画デコーダーを統合し、プロンプトの追従性と描画ディテールを向上させている。
2. 影響(Why)
- マルチショットの一貫性保持: 従来の単一連続ショット生成と異なり、カットをまたいでもキャラクターや照明条件が維持されるため、編集工程を大幅に削減できる。
- ローカル環境での完全制御: 従量課金やセット単位のロックインがないため、社内データやプライベートなアセットを用いた安全なファインチューニングと運用が可能になる。
3. 根拠・詳細(How)
- コンポーネント別分割パックの構造: ディフュージョントランスフォーマー(22B distilled)、テキストエンコーダー(Gemma 4 12B)、ビデオ VAE、オーディオ VAE などの各コンポーネントが .safetensors 形式で分割提供されており、ltx-pipelines または Diffusers 経由でロードする。
- 動作環境と実行仕様: Python >= 3.12、CUDA >= 12.7、PyTorch ~= 2.7 が推奨されており、--quantization fp8-cast と --offload cpu フラグを用いて 24GB 級の単一 GPU でも効率的に実行可能である。
4. 展望・課題(Next)
- Diffusers 正式リリースへの対応: 現時点では diffusers の main ブランチからのインストールが必要だが、今後の正式リリース版への統合が進められる予定。