🧠Research🔥🔥

Black Forest Labs、動画・行動モデル「FLUX 3 x mimic」を公開──ロボット制御を統合

FLUX 3 基盤モデルにロボットの行動予測を統合し、Audi の生産ラインで実証済みの汎用マニピュレーション能力を実現した。
リリース: 2026-07-23 · 読了 5

記事の要約

1. 核心(What)

  • Black Forest Labs がマルチモーダル基盤モデル FLUX 3 を発表し、その応用としてロボット制御モデル FLUX-mimic を公開した。
  • FLUX 3 は画像・動画・音声を単一のバックボーンで学習し、計算コストの 95% 以上を動画予測(物理法則の学習)に割り当てている。
  • FLUX-mimic は、FLUX 3 の中間特徴量から行動を抽出する軽量なデコーダーを構築し、Audi の生産ラインで実用試験を実施した。

2. 影響(Why)

  • 物理世界理解の統合: 動画生成で培った「物理法則の理解」をロボット制御に転用することで、個別の行動モデルを構築するより汎用的な操作が可能になる。
  • 国内製造業への示唆: 国内の製造・物流現場で自動化を推進する中規模 SIer は、汎用的な視覚基盤モデルをベースにすることで、特定タスクごとの学習コストを大幅に削減できる可能性がある。

3. 根拠・詳細(How)

  • Self-Flow による学習: 生成品質と表現学習を統合する「Self-Flow」フレームワークを採用し、動画予測とロボットの成功率を同時に最適化している。
  • 学習ステップの効率性: 行動予測の追加学習時、初期の動画生成品質は最大 10% 低下するが、3,500 ステップの学習で元の品質を回復し、単一バックボーンでの共存を達成した。

4. 展望・課題(Next)

  • 実環境での展開: 現在、パーツのトレイ詰めや電子制御ユニットの挿入など、Audi の実生産ラインにおける実用化フェーズを継続している。