🧠Research🔥🔥

OpenBMB、MiniCPM5-2B 用モデル MiniCPM5-2B-DSpark を公開──324M パラメータで 6 トークン同時受入を実現

MiniCPM5-2B の推論高速化に向け、324M パラメータの専用ドラフトモデルを公開。SGLang によるマルチトークン検証でレイテンシを削減する。
リリース: 2026-10-03 · 読了 3 分

記事の要約

1. 核心(What)

  • OpenBMB は MiniCPM5-2B の推論を加速させる 324M パラメータのドラフトモデル MiniCPM5-2B-DSpark を公開した。
  • 貪欲デコードにおける 1 パスあたりの平均受入長は 5.52 トークン(温度 1.0 時は 4.05 トークン)に達する。
  • 数学およびコード領域ではそれぞれ 6.05 および 6.11 トークンの受入数を検証ステップごとに記録している。
  • SGLang 推論サーバーにおいて --speculative-algorithm DSPARK オプションを指定し、ブロックサイズ 7 で動作する。

2. 影響(Why)

  • 推論スループットの大幅な向上: 2.52B パラメータのターゲットモデルに対し、軽量な 324M モデルで複数トークンを同時提案させるため、ハードウェア追加なしでスループットを大きく引き上げられる。
  • 国内サーバー運用のコスト削減: 国内のエッジ AI やオンプレミス環境で MiniCPM5-2B を稼働させる事業者にとって、推論レイテンシとサーバーコストのトレードオフを改善する実用的な手段となる。

3. 根拠・詳細(How)

  • DSpark 半自己回帰ドラフト機構: 並列バックボーンと軽量な逐次モジュールを組み合わせることで、ブロック内の後続トークンで生じやすいサフィックス減衰を防ぐ設計になっている。
  • 学習データとロス設計: 7.05B トークンを用い、6 エポックにわたってクロスエントロピー、L1、および信頼度ロス(confidence loss)の目的関数で学習されている。
  • SGLang による実装とライセンス: SGLang の --speculative-algorithm DSPARK およびブロックサイズ 7 の設定で動作し、ライセンスは Apache 2.0 が適用される。

4. 展望・課題(Next)

  • 実ワークロードでの評価: 公開されたベンチマークは複合タスクに基づくため、実際の業務データを用いたレイテンシ検証とスループット測定が必要となる。