🧠Research🔥🔥

Apple ML Research、マルチモーダル統合アーキテクチャ STARFlow2 を公開──自己回帰型フローで画像生成と理解を単一パス化

自己回帰型正規化フローを LLM と同等の因果マスク構造で統合し、テキストと視覚出力を同一の KV キャッシュ上で直接処理可能な単一パス生成を実現した。
リリース: 2024-05-14 · 読了 3

記事の要約

1. 核心(What)

  • Apple ML Research が、マルチモーダル生成・理解のための統合アーキテクチャ「STARFlow2」を発表
  • 自己回帰型正規化フローが LLM と同様の因果マスクや KV キャッシュ構造を共有する点に着目した
  • 凍結された事前学習済み VLM ストリームと TARFlow ストリームを残差スキップ接続で垂直統合する Pretzel アーキテクチャを採用した
  • 深浅フロー設計と統一 FAE 潜在空間により、テキストと視覚出力が再エンコードなしで直接 KV キャッシュにエントリーする仕組みを構築した

2. 影響(Why)

  • KV キャッシュ共有による推論効率化: 視覚・言語モダリティの統合において別系統の拡散モデルを排除し、LLM と同一の因果機構で単一パス処理できるため、マルチモーダル推論時のパイプライン遅延を根本から削減できる。
  • 国内マルチモーダル開発への設計影響: 独自にマルチモーダル基盤を構築する国内の画像生成・LLM 統合開発チーム(例えばマルチモーダル AI を手掛ける中小規模の受託開発・SaaS 企業)は、拡散モデル併用による複雑なパイプライン設計から、自己回帰フローベースの単一パス構成へ移行する検証を進める価値がある。

3. 根拠・詳細(How)

  • Pretzel アーキテクチャによる垂直統合: 事前学習済みの Vision-Language Model ストリームを凍結したまま、TARFlow ストリームと残差スキップ接続を介して結合し、双方で同一の因果マスクを共有する設計とした。
  • 統合 FAE 潜在空間とキャッシュフロー設計: 深浅フロー設計により連続値の画像生成を高精度に維持しつつ、視覚出力を直接 KV キャッシュに統合することで再エンコードを回避する仕組みを実装した。

4. 展望・課題(Next)

  • 各種ベンチマークでの汎化性能検証: 画像生成およびマルチモーダル理解の主要ベンチマークにおいて、従来の拡散モデルや離散トークン化手法との詳細な性能比較が進められている。