🧠Research🔥🔥

Red Hat、NVIDIA Nemotron 3.5 Lightning 30B の FP8 量子化モデルを公開──GPU メモリを約半分に削減

BF16 版の重みを FP8 に変換し、単一アクセラレータでの推論を容易にしたエージェント向けモデルの量子化版。
リリース: 2026-10-03 · 読了 3 分

記事の要約

1. 核心(What)

  • Red Hat AI が NVIDIA Nemotron 3.5 Lightning 30B の FP8 量子化モデルをリリースした。
  • BF16 参照重みと比較して GPU メモリおよびディスク容量を約半分に圧縮する。
  • ベースモデルは 3B アクティブパラメータを持つ Mamba-2 + MoE + Attention のハイブリッド構造である。
  • Hugging Face でのダウンロード数は公開時点で 780,000 件を突破した。

2. 影響(Why)

  • ハードウェア要件の引き下げ: 単一の H100 または DGX Spark で 30B モデルを運用可能になり、マルチ GPU の調達コストが不要になる。
  • 国内インフラへの適用性: [国内 AI ソリューション企業] のような中堅 SIer は、限られた社内検証リソースで大規模エージェントの挙動評価を回せる。

3. 根拠・詳細(How)

  • LLM Compressor による静的量子化: LLM Compressor を用いて線形演算子の重みと活性化に静的テンソル単位の FP8 量子化を適用し、512 件の UltraChat サンプル(各 2,048 トークン)で校正を実施した。
  • 非量子化コンポーネントの保持: conv1d 層、埋め込み、潜在射影、MoE ゲート、多トークン予測層、言語モデルヘッドなどは精度維持のため BF16 のまま未量子化で残している。

4. 展望・課題(Next)

  • ランタイム全体のメモリ影響評価: Mamba 状態や Attention の KV キャッシュなど未量子化要素も存在するため、実際のサービング構成でのメモリ削減効果の測定が必要となる。