Viggle、画像生成高速化モデル Qwen-Image-2.1-viggle-turbo を公開──6ステップ推論で端・細部品質を維持
Qwen-Image-2.1 をベースに Distribution Matching Distillation で蒸留し、40ステップのベースモデル比で約5倍の高速化と商用利用可能な品質を両立した。
リリース: 2026-09-22 · 読了 3 分記事の要約
1. 核心(What)
- ViggleがQwen-Image-2.1をベースに訓練した蒸留モデル「Qwen-Image-2.1-viggle-turbo」をHuggingFace Spacesで公開した。
- Distribution Matching Distillationを用い、通常40ステップ必要な推論を6ステップへと短縮している。
- v0.2.1チェックポイントでは、LoRAアダプター(rank 256、bf16、1.3GB)をベースモデルにランタイムでロードして実行する仕様となっている。
- 96件の検証用プロンプトにおいて、ベースモデルと遜色ない構図維持力と多様性を確保している。
2. 影響(Why)
- 推論コストの劇的な圧縮: 40ステップの計算負荷を6ステップに削ることで、生成あたりのGPUホスティングコストを大幅に削減でき、リアルタイムUIへの組み込みが現実的になる。
- 既存ワークフローへの親和性: ComfyUIのカスタムノードやdiffusersのパイプラインへそのまま組み込めるため、プロダクション環境への移行リスクや検証コストを最小化できる。
3. 根拠・詳細(How)
- DMDとSenseFlowベースの蒸留機構: Distribution Matching Distillation(DMD)にSenseFlowスタイルのセグメント内ガイダンスを組み合わせ、教師モデルの速度を学習させている。
- シグマスクジュールの最適化: num_inference_steps=6とし、sigmas=[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25] のカスタムスケジュールを適用することで、高ノイズ領域でのレイアウトの崩れやゴーストを防止している。
- SVDによるLoRAの軽量化: rank 256のアップデートに対し正確な層ごとの特異値分解(SVD)を適用し、更新エネルギーの83〜100%を維持したままrank 128(680MB)への切り詰めを実現している。
4. 展望・課題(Next)
- 複雑なマルチ参照編集の改善: 複数画像の合成やフェイススワップなど、複雑な制約を持つ編集タスクにおけるベースモデルとの品質差を詰めるべく、継続的なアップデートが予定されている。