NVIDIA、推論サーバー Dynamo-Triton による HSTU ジェネレーティブ推薦モデルのデプロイワークフローを公開──最大 5.93 倍の高速化を実現
PyTorch AOTI コンパイルと FlexKV による GPU キャッシングを組み合わせ、長文脈の推薦クエリを低レイテンシで処理する本番環境向け実用パスを提供。
リリース: 2026-09-30 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA Dynamo-Triton が recsys-examples リポジトリを通じて HSTU ジェネレーティブ推薦モデルの統合推論ワークフローを提供開始
- PyTorch AOTI コンパイル、FlexKV による KV キャッシュ、NV Embedding Cache を統合した実用的なデプロイパスを確立
- RTX PRO 6000 Blackwell Workstation 評価環境で、KV キャッシュ適用により 8 層 HSTU モデルで最大 5.93 倍の高速化を実証
- Python 開発環境から Dynamo-Triton の C++ ネイティブサービングまでを一貫して検証できるアーキテクチャを整備
2. 影響(Why)
- 長文脈推薦モデルの実用化: 従来の分割型リトリーバル・ランキング構造ではなく一連のシーケンスモデルとして扱う GR において、計算負荷の高い長文脈履歴の再計算を抑制できる。
- 国内大規模サービスのインフラコスト削減: レコメンドモデルの推論レイテンシと GPU メモリ消費を同時に抑えられるため、アクセス集中時のインフラ費用対効果を飛躍的に改善できる。
3. 根拠・詳細(How)
- AOTI コンパイルと KV キャッシュ: PyTorch の torch.export および AOTI を用いてモデルを事前コンパイルし、FlexKV と連携する paged KV キャッシュによって重複計算を排除する。
- 階層型埋め込みキャッシュ設計: DynamicEmb と NV Embedding Cache を組み合わせ、高頻度な埋め込みのみを GPU メモリに保持してメモリ使用量を抑制する。
4. 展望・課題(Next)
- マルチプラットフォーム対応の拡大: 今後、さまざまな GPU アーキテクチャ上での最適化や、大規模バッチ処理におけるスケーラビリティの検証が続けられる予定。