🧠Research🔥🔥

Reka、逆動力学モデル RIDM を公開──ゲームプレイ動画から WASD キーや視線を逆推定

ゲームプレイのエンジン真値を元に学習したコンパクトな逆動力学モデル RIDM を Apache 2.0 で公開し、実動画でのアクション分類精度で 85.9% を記録した。
リリース: 2026-10-02 · 読了 3 分

記事の要約

1. 核心(What)

  • Reka は、未ラベルの動画から WASD キーや視線(ヨー・ピッチ)の確率を推論する逆動力学モデル RIDM を発表した。
  • モデルアーキテクチャには凍結した RAFT-small を使うフロー版(2.8M パラメータ)と IMPALA トランクを使うピクセル版(9.8M パラメータ)の 2 種類がある。
  • ゲームエンジンの真値を用いて学習され、実世界の実動画を用いたアクション分類評価ではフロー版が 85.9% の精度を記録した。
  • 重みは HuggingFace にて safetensors 形式で Apache 2.0 ライセンスのもと公開されている。

2. 影響(Why)

  • ドメインギャップの解消: オプティカルフローにより色や質感を削ぎ落としてモーションのみを抽出するため、ゲーム画面と実世界の映像間で発生するドメインギャップを抑えつつ高精度な推論が可能になる。
  • 疑似ラベル生成の効率化: YouTube などの未ラベル実映像から高精度な行動疑似ラベルを自動生成できるため、インタラクティブモデル学習におけるデータ収集のボトルネックを解消できる。
  • 国内実務への波及効果: 国内の動画処理やエンターテインメント系 AI アプリ開発チームは、手動アノテーションコストをかけずに既存動画から動作コンテキストを抽出するパイプラインを構築できる。

3. 根拠・詳細(How)

  • 2種類のアーキテクチャとパラメータ数: フロー版は凍結された RAFT-small と学習可能なトランスフォーマーで合計 2.8M パラメータ、ピクセル版は IMPALA トランクで 9.8M パラメータを構成している。
  • モーション特化型のサンプリング設計: 1280x720・48 fps のゲームプレイ映像から、前進・旋回・横移動など 5 つのモーションプール(合計約 31 万クリップ)をサンプリングして訓練セットを構築した。
  • ファイル構成と依存関係の仕様: HuggingFace の配布物は safetensors 形式の重み、config.json、inference.py スクリプトを含み、フロー版は Torchvision の事前学習済み RAFT-small への依存を持つ。

4. 展望・課題(Next)

  • 弱点領域のフィルタリング実装: 静止フレームやズーム効果、スタビライズ処理された映像ではオプティカルフローが弱まるため、本番パイプラインでは低信頼度セグメントの事前フィルタリングが必要となる。
  • ロボット制御への適用課題: RIDM が出力する一人称視点の制御量を、対象ロボットのアクチュエータ空間へ変換する独立したマッピング層の追加開発が求められる。