Microsoft、コーデック統合型 VLM「Mage-VL」を公開──視覚トークンを 75% 削減し推論速度 3.5 倍に向上
動画コーデックの I/P フレーム構造を視覚エンコーダに持ち込み、動的領域のみを処理することで 4B スケールで最高水準の動画・ストリーミング理解を実現した。
リリース: 2026-07-26 · 読了 4 分記事の要約
1. 核心(What)
- Microsoft は 2026 年 7 月 26 日、コーデックネイティブなストリーミング VLM「Mage-VL」を公開した。
- 動画コーデックの I/P フレーム構造を模倣し、動きのある領域のパッチのみを保持することで視覚トークンを 75% 以上削減している。
- Qwen3-4B を因果デコーダとして採用し、視覚とテキストのトークンを単一の MLP プロジェクターで統合する。
- System 1(軽量な認知ゲート)と System 2(フル VLM)の二重プロセス設計により、追加のマルチエージェントなしでプロアクティブなストリーミングを実現する。
2. 影響(Why)
- 計算コストの壁を破るトークン削減: 従来の等間隔フレームサンプリングが抱える冗長なパッチ処理を排除することで、画質を維持したまま最大 3.5 倍の推論速度向上を実現している。
- 国内動画 SaaS への実装優位性: 国内のライブコマースやスポーツ解析を手がける中規模事業者は、単一の GPU ノードでストリーミングとオフライン解析を同時に回せるためインフラコストを最適化できる。
3. 根拠・詳細(How)
- Mage-ViT によるパッチ選択: 16x16 パッチグリッド上で全てのアンカー(I)フレームパッチを保持し、動きのある予測(P)フレームパッチのみを選択的に残すことで、3D RoPE と共に時空間コンテキストを維持する。
- 5段階の段階的カリキュラム学習: 数百万件規模のキャプション、画像・動画インストラクション、コーデックネイティブな長文脈適応、ストリーミング整列を経て単一のモデルウェイトに統合される。
4. 展望・課題(Next)
- オープンソースエコシステムへの展開: スタンドアロンの視覚エンコーダ「Mage-ViT」のチェックポイントも公開されており、独自のマルチモーダル学習への組み込みが進むと見込まれる。