NVIDIA、推論サーバー構成管理ツール Cluster Readiness Engine を公開──Kubernetes で 512-GPU クラスターの障害を事前隔離
NVIDIA が Kubernetes 環境向けのオープンソースコントローラーを公開し、分散トレーニング開始前にハードウェア障害や帯域低下を特定可能にした。
リリース: 2026-09-23 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA は Kubernetes 上で分散 GPU クラスターの稼働準備状況を検証するオープンソースコントローラー「NVCRE」を公開した。
- API は Certification、Workflow、Job の 3 階層で構成され、GitOps ワークフローを通じた宣言的管理が可能である。
- ビルトインカタログには 5 種類の NCCL 通信テスト、DCGM 診断、Nemotron 5 (8B/56B) 事前トレーニングが含まれる。
- グループテストの自動分割機能により、数十ノード規模のテストで低帯域の原因となっているノードをピンポイントで特定する。
2. 影響(Why)
- 本番投入前の障害自動隔離: 従来の Kubernetes では実ワークロードを実行するまでハードウェアの潜在的不具合に気づきにくかったが、NVCRE によりデプロイ前の検出が可能になる。
- 国内インフラ運用への効果: 国内のオンプレミス AI 基盤を運用するデータセンター事業者は、手動による NCCL マニフェスト作成や切り分け作業を自動化し、クラスター稼働率を向上させられる。
3. 根拠・詳細(How)
- CRD による階層型リソース管理: Certification リソースが対象ノードと検証カテゴリを定義し、Workflow がパラメータや反復回数を管理、Job が実ワークロードを実行して結果を上位に集約する。
- CEL を用いたパス・フェイル判定: Common Expression Language を使い、例えば busBandwidthGBps: "value >= 900" のようなカスタムしきい値でメトリクスを評価する。
- トポロジー認識型の診断機構: testScale: diagnose により、失敗したグループを自動分割して再実行を繰り返し、最小グループサイズから問題ノードを特定する。
4. 展望・課題(Next)
- Kubernetes エコシステムとの統合: KAI Scheduler などの gang 認識型スケジューラーとの組み合わせによる、マルチノードデッドロック回避策の標準化が進む見通し。