🧠Research🔥🔥

Google Research、画像生成制御フレームワーク Diffusion Controller を発表──軽量ステアリングダンパーでプロンプト整合性と画質を最適化

ベースモデルの重みを完全凍結したまま軽量な補助ネットワークでプロンプト追従性を高め、ブラックボックスモデルでも LoRA を上回る制御を実現した。
リリース: 2026-09-17 · 読了 3 分

記事の要約

1. 核心(What)

  • Google Research は画像生成のノイズ除去プロセスを連続制御問題として再定義する Diffusion Controller フレームワークを発表した。
  • ベースモデルを完全に凍結したまま、軽量なステアリングダンパーネットワークを接続して推論軌道を動的に補正する。
  • Stable Diffusion v1.4 バックボーンを用いて、SFT、RWL、PPO の 3 つのファインチューニング手法で検証を実施した。
  • Human Preference Score (HPS-v2) ベンチマークおよび人間の評価パネルにおいて、既存の LoRA 手法を上回る品質とプロンプト整合性を実証した。

2. 影響(Why)

  • モデルを凍結した安全な制御: ベースモデルの重みを変更せず外部から微小な補正を注入するため、モデル本来の視覚的安定性を一切崩さずにプロンプト整合性を高められる。
  • クローズドモデルへの適用拡大: ホワイトボックス環境だけでなく、制限されたグレーボックス環境でも LoRA を凌駕する性能を発揮するため、API 経由のモデル制御における選択肢が広がる。

3. 根拠・詳細(How)

  • ステアリングダンパー機構: ベースモデルの知識に小さな補正を組み合わせることで、画像生成のノイズ除去軌道を動的に recalibrate(再校正)する軽量ネットワークを実装。
  • HPS-v2 によるベンチマーク評価: Stable Diffusion v1.4 をバックボーンに採用し、Human Preference Score (HPS-v2) を指標として複雑な複数属性プロンプトに対する整合性を検証。

4. 展望・課題(Next)

  • パーソナライゼーションと動画への拡張: 今後は個人の嗜好に合わせた高度なパーソナライゼーションツールや、有害コンテンツ生成を抑制する堅牢な安全性メカニズム、さらには次世代の複雑な動画生成モデルへの適応を進める。