🛠Tools🔥🔥

NVIDIA、推論サーバー構成管理ツール Cluster Readiness Engine を公開──Kubernetes で 512-GPU クラスターの障害を事前隔離

NVIDIA が Kubernetes 環境向けのオープンソースコントローラーを公開し、分散トレーニング開始前にハードウェア障害や帯域低下を特定可能にした。
リリース: 2026-09-23 · 読了 3

記事の要約

1. 核心(What)

  • NVIDIA は Kubernetes 上で分散 GPU クラスターの稼働準備状況を検証するオープンソースコントローラー「NVCRE」を公開した。
  • API は Certification、Workflow、Job の 3 階層で構成され、GitOps ワークフローを通じた宣言的管理が可能である。
  • ビルトインカタログには 5 種類の NCCL 通信テスト、DCGM 診断、Nemotron 5 (8B/56B) 事前トレーニングが含まれる。
  • グループテストの自動分割機能により、数十ノード規模のテストで低帯域の原因となっているノードをピンポイントで特定する。

2. 影響(Why)

  • 本番投入前の障害自動隔離: 従来の Kubernetes では実ワークロードを実行するまでハードウェアの潜在的不具合に気づきにくかったが、NVCRE によりデプロイ前の検出が可能になる。
  • 国内インフラ運用への効果: 国内のオンプレミス AI 基盤を運用するデータセンター事業者は、手動による NCCL マニフェスト作成や切り分け作業を自動化し、クラスター稼働率を向上させられる。

3. 根拠・詳細(How)

  • CRD による階層型リソース管理: Certification リソースが対象ノードと検証カテゴリを定義し、Workflow がパラメータや反復回数を管理、Job が実ワークロードを実行して結果を上位に集約する。
  • CEL を用いたパス・フェイル判定: Common Expression Language を使い、例えば busBandwidthGBps: "value >= 900" のようなカスタムしきい値でメトリクスを評価する。
  • トポロジー認識型の診断機構: testScale: diagnose により、失敗したグループを自動分割して再実行を繰り返し、最小グループサイズから問題ノードを特定する。

4. 展望・課題(Next)

  • Kubernetes エコシステムとの統合: KAI Scheduler などの gang 認識型スケジューラーとの組み合わせによる、マルチノードデッドロック回避策の標準化が進む見通し。