Google Research、画像生成モデル向けアーキテクチャ Diffusion Controller を公開──HPS-v2 で 90% の勝率を記録
凍結したベースモデルの重みを変更せず、サンプリング時の各ステップに横付けする小規模ネットワークでプロンプト追従性を最適化する。
リリース: 2026-09-29 · 読了 3 分記事の要約
1. 核心(What)
- Google Research は、拡散モデルのデノイズ過程に横付けしてプロンプト追従性を高める小規模サイドネットワーク「Diffusion Controller」を発表した。
- Stable Diffusion v1.4 バックボーンを使った実験において、ホワイトボックス版は HPS-v2 ベンチマークでベースライン比 90% の勝率を記録した。
- グレーボックス版は、モデルの内部層を変更する LoRA と比較して、より少ない層の修正で同等以上の HPS-v2 勝率を実現した。
- PPO(近傍政策最適化)や報酬重み付け損失(RWL)などの訓練手法に対応し、推論時には単一のガイダンス強度パラメータで補正量を制御できる。
2. 影響(Why)
- LoRA 運用コストの圧縮: LoRA のように多数のモデル層を再学習させる必要がなく、小規模なサイドネットワークの追加のみでファインチューニングや報酬最適化を行えるため、モデル管理とデプロイの手間が削減される。
- 国内画像生成 SaaS への影響: ComfyUI や自社製パイプラインを運用する国内画像生成サービス(受託制作・キャラクター生成系)は、モデル本体の重みを固定したまま特定のスタイリングやブランド安全性を後付け制御する実用的な選択肢が増える。
3. 根拠・詳細(How)
- 制御理論に基づくデノイズ補正機構: デノイズ過程の状態をシステム状態、サイドネットワークの補正をアクションと見なし、中間レイテント状態を観測して各ステップの遷移を直接修正する。
- PPO および RWL による訓練手法: 生成軌跡をサンプリングして画像報酬でスコアリングし、クリップ付きポリシー変更を用いる PPO や、高報酬の軌跡に重みを置く直接回帰損失を用いてコントローラーを最適化する。
- アクセス要件と実装制約: 中間レイテント状態の観測とステップごとの補正を許可するサンプラーレベルのフックが必要であり、通常のプロンプト入力・画像出力型 API では動作しない。
4. 展望・課題(Next)
- 今後の応用展開: 研究チームは今後のターゲットとして、パーソナライゼーション、安全性フィルターの強化、および動画拡散モデルへの拡張を挙げている。
- 実装の公開状況: 現時点では公式のオープンソース実装やコードは公開されておらず、論文に基づくアーキテクチャの独自再現が必要となる。