🧠Research🔥🔥🔥

Viggle、画像生成高速化モデル Qwen-Image-2.1-viggle-turbo を公開──6ステップ推論で端・細部品質を維持

Qwen-Image-2.1 をベースに Distribution Matching Distillation で蒸留し、40ステップのベースモデル比で約5倍の高速化と商用利用可能な品質を両立した。
リリース: 2026-09-22 · 読了 3 分

記事の要約

1. 核心(What)

  • ViggleがQwen-Image-2.1をベースに訓練した蒸留モデル「Qwen-Image-2.1-viggle-turbo」をHuggingFace Spacesで公開した。
  • Distribution Matching Distillationを用い、通常40ステップ必要な推論を6ステップへと短縮している。
  • v0.2.1チェックポイントでは、LoRAアダプター(rank 256、bf16、1.3GB)をベースモデルにランタイムでロードして実行する仕様となっている。
  • 96件の検証用プロンプトにおいて、ベースモデルと遜色ない構図維持力と多様性を確保している。

2. 影響(Why)

  • 推論コストの劇的な圧縮: 40ステップの計算負荷を6ステップに削ることで、生成あたりのGPUホスティングコストを大幅に削減でき、リアルタイムUIへの組み込みが現実的になる。
  • 既存ワークフローへの親和性: ComfyUIのカスタムノードやdiffusersのパイプラインへそのまま組み込めるため、プロダクション環境への移行リスクや検証コストを最小化できる。

3. 根拠・詳細(How)

  • DMDとSenseFlowベースの蒸留機構: Distribution Matching Distillation(DMD)にSenseFlowスタイルのセグメント内ガイダンスを組み合わせ、教師モデルの速度を学習させている。
  • シグマスクジュールの最適化: num_inference_steps=6とし、sigmas=[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25] のカスタムスケジュールを適用することで、高ノイズ領域でのレイアウトの崩れやゴーストを防止している。
  • SVDによるLoRAの軽量化: rank 256のアップデートに対し正確な層ごとの特異値分解(SVD)を適用し、更新エネルギーの83〜100%を維持したままrank 128(680MB)への切り詰めを実現している。

4. 展望・課題(Next)

  • 複雑なマルチ参照編集の改善: 複数画像の合成やフェイススワップなど、複雑な制約を持つ編集タスクにおけるベースモデルとの品質差を詰めるべく、継続的なアップデートが予定されている。