Black Forest Labs、マルチモーダルモデル FLUX 3 を発表──動画・音声・ロボット制御を統合
画像・動画・音声を単一のバックボーンで学習し、Runway Gen-4.5 を上回る生成精度と工場ロボット制御への応用を実現した。
リリース: 2026-07-23 · 読了 3 分記事の要約
1. 核心(What)
- Black Forest Labs が画像・動画・音声を単一アーキテクチャで学習する基盤モデル FLUX 3 を公開。
- 動画生成機能は最大 20 秒の音声付き出力をサポートし、Text-to-Video、Image-to-Video、Video-to-Video に対応。
- Audi の工場現場において、同一のモデルバックボーンがロボット制御(FLUX 3 Action)に応用されている。
2. 影響(Why)
- 世界モデルの統合的理解: 画像・動画・音声を個別のエンコーダを通さず同時学習することで、物理法則や因果関係を内包した一貫性のある世界モデルを構築可能にする。
- 国内製造業への波及: 国内の製造業・ロボット開発に従事する中規模以上のエンジニアチームは、汎用的な視覚・物理推論モデルを自社の制御タスクに転用する設計を検討すべき。
3. 根拠・詳細(How)
- Self-Flow 学習手法の採用: CLIP や DINO といった外部の固定エンコーダに依存せず、表現学習と生成を同一パスで実行する Self-Flow 手法により、マルチモーダル間の整合性を最適化。
4. 展望・課題(Next)
- FLUX 3 Image の順次展開: 現在早期アクセスが開始されている動画・アクション生成モデルに続き、画像生成特化版の FLUX 3 Image が数週間以内にリリース予定。