🧠Research🔥🔥

Prime Intellect、推論基盤 Prime Inference を公開──日量 6000 億トークン処理と NVFP4 キャッシュ圧縮を実現

Blackwell 世代の GB200 NVL72 を活用し、プレフィル・デコード分離と KV キャッシュ圧縮により長文脈エージェント処理の遅延を大幅に削減した。
リリース: 2026-10-02 · 読了 4 分

記事の要約

1. 核心(What)

  • Prime Intellect は毎日約 6,000 億トークンを処理する商用推論スタック「Prime Inference」の提供を開始した
  • GB200 NVL72 上で稼働する GLM-5.3 エンドポイントは 66 の同時セッションを維持し、1 ユーザーあたり 101 トークン/秒の生成速度を記録した
  • NVFP4 による KV キャッシュ圧縮によりキャッシュ行が 576 バイトから 352 バイトへ縮小し、デコーダ容量が 50% 増加した
  • NVIDIA Dynamo を用いたプレフィルとデコードの分離により、p90 トークン間レイテンシが約 40% 削減された

2. 影響(Why)

  • 長文脈エージェント開発のコスト壁を突破: 140,000 トークン超のプロンプトと長時間のキャッシュ再利用を伴うコーディングエージェントにおいて、数千トークン規模のターンでも遅延を抑えられるため、本番導入のインフラ設計が現実的になる。
  • 国内 SaaS のカスタムモデル運用への波及: [国内 AI アプリ開発ベンダー] のような中規模事業者は、自社ファインチューニングモデルをサーバーレスまたはリザーブド容量で外部ホスティングする際に、オープンウェイトモデルの高速推論構成をそのまま適用できる。

3. 根拠・詳細(How)

  • NVFP4 によるオンチップ非同期キャッシュ圧縮: FlashInfer にコントリビュートされたネイティブスパースアテンションカーネルにより、ストレージ形式としての NVFP4 を維持しつつ、アテンション計算は FP16 オペランドと FP32 累積で実行される。
  • ブロックメジャー KV レイアウトによる NVLink 効率化: vLLM コミュニティの BLHNC レイアウトを採用し、複数層のデータをブロックごとに連続配置することで転送デスクリプタ数を約 10 分の 1 に削減した。

4. 展望・課題(Next)

  • バッチおよび非同期推論の追加: オフラインの低コストバッチ処理に対応するため、バッチおよび非同期推論機能の実装が予定されている。
  • 学習から推論へのワンクリック展開: Prime の学習ランで得られたファインチューニングモデルを、リザーブド容量へワンクリックでデプロイする機能のサポートが計画されている。