🧠Research🔥🔥🔥

NVIDIA、推論特化モデル NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 を公開──3B アクティブパラメータと 1M トークン長を実現

Mamba と MoE を組み合わせたハイブリッド構造により、30B 全体パラメータのうちアクティブ 3B で高スループット推論と 1M トークンの長文脈処理を両立した。
リリース: 2026-08-14 · 読了 4

記事の要約

1. 核心(What)

  • 総パラメータ数 30B、アクティブパラメータ 3B の Mixture-of-Experts ハイブリッド構造を持つ大規模言語モデルが公開された。
  • プレトレーニングのデータカットオフは 2025 年 9 月、ポストトレーニングのカットオフは 2026 年 5 月で、20T トークン以上のデータで学習されている。
  • 最大 1M トークンの長文脈入力に対応し、英語および日本語を含む多言語のチャット、コード生成、ツール利用タスクをサポートする。
  • 推論高速化のために DSpark や DFlash といった speculative decoding 手法、および Multi-Token Prediction (MTP) 層を備える。

2. 影響(Why)

  • ローカルハードウェアでの高効率推論: アクティブパラメータが 3B に抑えられているため、H100 単一 GPU や DGX Spark などの限られたリソースで 1M トークンの長文脈処理を現実的なレイテンシで回せるようになる。
  • 国内エッジ・社内 AI 開発への波及: 国内のオンプレミス環境で高精度な推論サーバーを運用したい中規模の AI 開発・SaaS 事業者は、商用利用可能な NVFP4 量子化モデルとして有力な選択肢が増える。

3. 根拠・詳細(How)

  • ハイブリッド構造と Mamba の統合: Mamba-2 層と MoE 層をインターリーブさせたハイブリッドアーキテクチャを採用し、FlashInfer バックエンドを用いてメモリ効率を最適化している。
  • NVFP4 による量子化レシピ: Nvidia Model Optimizer を用いて Four Over Six NVFP4 (W4A16) の静的 MSE キャリブレーションによる量子化を行い、メモリフットプリントを大幅に削減している。

4. 展望・課題(Next)

  • 評価とエコシステムの展開: NeMo Gym および NeMo Evaluator SDK を用いた評価レシピが公開されており、開発者は自身の環境での再現検証が可能となっている。