🧠Research🔥🔥

Dharma AI、制約考慮型 GPU アロケータを発表──同一ハードウェアで利用率を最大 33 ポイント改善

FIFO スケジューラの静的な最大値予約と到着順配置を見直し、リアルタイム推論とバッチ処理の混在環境で優先度付き出力を最大 105% 向上させた。
リリース: 2026-08-17 · 読了 4

記事の要約

1. 核心(What)

  • Dharma AI は、同一ハードウェア環境下において GPU 利用率を最大 33 パーセントポイント改善する制約考慮型 GPU アロケータを公開した。
  • 本手法は、FIFO(First-In, First-Out)スケジューラと比較して、優先度付き出力を全 7 シナリオですべて上回り、最大 105.1% の増加を記録した。
  • トレーニング、リアルタイム推論、バッチ推論、量子化の 4 種類のワークロードが競合するグリッド環境を対象に検証が行われた。
  • トレーニングヘビーな 8 GPU 環境のシナリオでは、利用率が 53.6% から 87.0% へ向上し、価値が 2 倍以上になった。

2. 影響(Why)

  • 静的予約の無駄を解消: リアルタイム推論の最大ピークに合わせて 24 時間 GPU を固定確保する従来方式はアイドル時間の無駄を生むため、需要曲線に応じた動的割り当てへの移行がインフラコスト直結の課題となる。
  • 国内 AI インフラ事業者への影響: [国内 LLM 基盤構築・クラウドサービス業種] のような大規模 GPU プールを運用する事業者は、到着順の FIFO から全体最適化スケジューラへ乗り換えることで、同一ハードウェアでのスループットを実質的に引き上げられる。

3. 根拠・詳細(How)

  • 制約条件の定義: GPU は 1 タイムステップにつき最大 1 ジョブを処理し、バッチ型ジョブは 2 のべき乗の連続ブロックを占有、実行中のジョブはプリエンプトされない制約条件として定式化している。
  • 目的関数の設計: バッチ型ジョブには優先度と時間減衰重みに応じた報酬を、リアルタイム推論の不足分には 5 から 10 倍のペナルティウェイトを課すことで、単一の最適化問題として解く構成。

4. 展望・課題(Next)

  • 大規模クラスタへのスケーリング検証: 64 GPU を超える実運用環境や、より多様な異種混在ワークロードにおける最適化アルゴリズムの計算オーバヘッドの評価が今後の課題となる。