Black Forest Labs、動画・行動モデル「FLUX 3 x mimic」を公開──ロボット制御を統合
FLUX 3 基盤モデルにロボットの行動予測を統合し、Audi の生産ラインで実証済みの汎用マニピュレーション能力を実現した。
リリース: 2026-07-23 · 読了 5 分記事の要約
1. 核心(What)
- Black Forest Labs がマルチモーダル基盤モデル FLUX 3 を発表し、その応用としてロボット制御モデル FLUX-mimic を公開した。
- FLUX 3 は画像・動画・音声を単一のバックボーンで学習し、計算コストの 95% 以上を動画予測(物理法則の学習)に割り当てている。
- FLUX-mimic は、FLUX 3 の中間特徴量から行動を抽出する軽量なデコーダーを構築し、Audi の生産ラインで実用試験を実施した。
2. 影響(Why)
- 物理世界理解の統合: 動画生成で培った「物理法則の理解」をロボット制御に転用することで、個別の行動モデルを構築するより汎用的な操作が可能になる。
- 国内製造業への示唆: 国内の製造・物流現場で自動化を推進する中規模 SIer は、汎用的な視覚基盤モデルをベースにすることで、特定タスクごとの学習コストを大幅に削減できる可能性がある。
3. 根拠・詳細(How)
- Self-Flow による学習: 生成品質と表現学習を統合する「Self-Flow」フレームワークを採用し、動画予測とロボットの成功率を同時に最適化している。
- 学習ステップの効率性: 行動予測の追加学習時、初期の動画生成品質は最大 10% 低下するが、3,500 ステップの学習で元の品質を回復し、単一バックボーンでの共存を達成した。
4. 展望・課題(Next)
- 実環境での展開: 現在、パーツのトレイ詰めや電子制御ユニットの挿入など、Audi の実生産ラインにおける実用化フェーズを継続している。