🧠Research🔥🔥

Apple、動画推論モデルの学習手法 Internalized Visual Thinking (IVT) を発表──推論レイテンシを 5 倍以上削減

推論時の画素生成を排除し、潜在表現の次フレーム予測を事後学習で最適化することで、Visual CoT と同等の精度を維持しながら高速化を実現した。
リリース: 2025-06-05 · 読了 3

記事の要約

3. 根拠・詳細(How)

  • Latency Reduction vs Visual CoT: スコア 5(baseline 1)
  • Apple Machine Learning Research (2025-06-05 公開)