NVIDIA、ロボットシミュレーション高速化ツール MjWarp を公開──最大 2,048 環境の並列処理を実現
MuJoCo の物理パイプラインを NVIDIA Warp 上で動作させ、GPU スケールでの一括ステップ実行により強化学習の総スループットを向上させる。
リリース: 2026-09-23 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA は MuJoCo の物理パイプラインを NVIDIA Warp 上で実装した MjWarp を公開した。
- SO-101 アームのモデルを使用し、最大 2,048 個の独立した並列環境でシミュレーションを実行するワークフローが示されている。
- NVIDIA Warp フレームワークは、Python ベースのカーネル記述と CUDA 向け動的コンパイルをサポートする。
- CUDA グラフキャプチャを利用して mjw.step の繰り返しディスパッチオーバーヘッドを削減できる。
2. 影響(Why)
- 総スループットの向上: 1 つの環境における遅延短縮ではなく、数千環境を同時並行で進めることで総ワールドステップ数を劇的に引き上げ、強化学習のデータ収集効率を高める。
- 既存 MJCF アセットの流用: 既存の MuJoCo 用シーン定義 (MJCF) をそのまま流用できるため、検証環境を再構築するコストを最小限に抑えられる。
3. 根拠・詳細(How)
- CUDA グラフキャプチャによる最適化: with wp.ScopedCapture() を用いて mjw.step の複数カーネル起動を一度にキャプチャし、既存バッファに対して再実行する設計をとる。
- パラメータの厳密なサイジング: nconmax、naconmax、njmax などのメモリ割当量を mjwarp-testspeed の --measure_alloc オプションを用いて調整し、オーバーフローを防ぐ。
4. 展望・課題(Next)
- ポリシー学習フレームワークとの統合: Isaac Lab (via Newton)、mjlab、MuJoCo Playground (MJX) を用いたポリシー学習への展開が予定されている。