Apple、動画推論モデルの学習手法 Internalized Visual Thinking (IVT) を発表──推論レイテンシを 5 倍以上削減
推論時の画素生成を排除し、潜在表現の次フレーム予測を事後学習で最適化することで、Visual CoT と同等の精度を維持しながら高速化を実現した。
リリース: 2025-06-05 · 読了 3 分記事の要約
3. 根拠・詳細(How)
- Latency Reduction vs Visual CoT: スコア 5(baseline 1)
- Apple Machine Learning Research (2025-06-05 公開)