NVIDIA、推論サーバー NVIDIA Dynamo-Triton 26.07 を公開──TensorRT マルチデバイス統合でマルチ GPU 処理を簡素化
TensorRT 11.0 と Dynamo-Triton 26.07 の連携により、単一の Triton モデルインスタンスで複数 GPU を協調動作させ、大規模モデルの推論レイテンシを大幅に短縮した。
リリース: 2026-09-21 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA Dynamo-Triton 26.07 が TensorRT バックエンドのマルチデバイス推論機能を有効化し、単一モデルインスタンスによる複数 GPU の並列処理を可能にした。
- NVIDIA Cosmos 3 Nano の 36 層デノイジングトランスフォーマーに対し、Ulysses コンテキスト並列を用いて 8 GPU までの分散処理を適用した。
- 1 つの gRPC エンドポイントでリクエストを受け付け、クライアント側で複数 GPU のランクを協調させるコードを書く必要を排除した。
- 8 GPU(CP8)構成において、トランスフォーマーの RPC 速度が単一 GPU 比で 6.09 倍に向上し、エンドツーエンドの生成時間が約 34 秒に短縮された。
2. 影響(Why)
- 推論インフラの複雑性を隠蔽: クライアント側が分散通信やランク管理のコードを持つ必要がなくなるため、アプリケーション層のアーキテクチャを変更せずにマルチ GPU の高速化恩恵を受けられる。
- レイテンシ重視のワークフローに直結: 生成時間が 2 分以上から 34 秒へ短縮されることで、ユーザーの待ち時間を減らし、インタラクティブなレビュー・修正サイクルを現実的なものにする。
3. 根拠・詳細(How)
- TensorRT の分散集合通信統合: Torch-TensorRT を用いたエクスポート時に、reduce-scatter、all-to-all、all-gather の各コンバーターが適用され、構成済みプランにトポロジがコンパイルされる。
- Triton の KIND_MODEL による複数 GPU 所有: config.pbtxt で `enable_multi_device` を true に設定し、`multi_device_gpus` で指定したランクごとに TensorRT 実行コンテキスト、CUDA ストリーム、NCCL 通信を割り当てる。
4. 展望・課題(Next)
- 同時リクエストスループットの評価: 今回のベンチマークは単一リクエストのレイテンシに絞られており、実運用に向けた並行リクエストのスループットや総所有コスト(TCO)の検証が推奨される。