Prime Intellect、推論基盤 Prime Inference を公開──日量 6000 億トークン処理と NVFP4 キャッシュ圧縮を実現
Blackwell 世代の GB200 NVL72 を活用し、プレフィル・デコード分離と KV キャッシュ圧縮により長文脈エージェント処理の遅延を大幅に削減した。
リリース: 2026-10-02 · 読了 4 分記事の要約
1. 核心(What)
- Prime Intellect は毎日約 6,000 億トークンを処理する商用推論スタック「Prime Inference」の提供を開始した
- GB200 NVL72 上で稼働する GLM-5.3 エンドポイントは 66 の同時セッションを維持し、1 ユーザーあたり 101 トークン/秒の生成速度を記録した
- NVFP4 による KV キャッシュ圧縮によりキャッシュ行が 576 バイトから 352 バイトへ縮小し、デコーダ容量が 50% 増加した
- NVIDIA Dynamo を用いたプレフィルとデコードの分離により、p90 トークン間レイテンシが約 40% 削減された
2. 影響(Why)
- 長文脈エージェント開発のコスト壁を突破: 140,000 トークン超のプロンプトと長時間のキャッシュ再利用を伴うコーディングエージェントにおいて、数千トークン規模のターンでも遅延を抑えられるため、本番導入のインフラ設計が現実的になる。
- 国内 SaaS のカスタムモデル運用への波及: [国内 AI アプリ開発ベンダー] のような中規模事業者は、自社ファインチューニングモデルをサーバーレスまたはリザーブド容量で外部ホスティングする際に、オープンウェイトモデルの高速推論構成をそのまま適用できる。
3. 根拠・詳細(How)
- NVFP4 によるオンチップ非同期キャッシュ圧縮: FlashInfer にコントリビュートされたネイティブスパースアテンションカーネルにより、ストレージ形式としての NVFP4 を維持しつつ、アテンション計算は FP16 オペランドと FP32 累積で実行される。
- ブロックメジャー KV レイアウトによる NVLink 効率化: vLLM コミュニティの BLHNC レイアウトを採用し、複数層のデータをブロックごとに連続配置することで転送デスクリプタ数を約 10 分の 1 に削減した。
4. 展望・課題(Next)
- バッチおよび非同期推論の追加: オフラインの低コストバッチ処理に対応するため、バッチおよび非同期推論機能の実装が予定されている。
- 学習から推論へのワンクリック展開: Prime の学習ランで得られたファインチューニングモデルを、リザーブド容量へワンクリックでデプロイする機能のサポートが計画されている。