ISTA-DASLab、非一律量子化モデル Qwen3.8-Flash-Next-GSQ-RCO-GGUF を公開──512エキスパート MoE のサイズを 5.3x 圧縮
各テンソル単位の感度に基づいた非一律量子化(GSQ・RCO)により、512 エキスパート MoE の 354 GB モデルを 66.4 GB(Q2_0)まで圧縮しつつ AIME25 で 96.67 を維持した。
リリース: 2026-04-20 · 読了 4 分記事の要約
1. 核心(What)
- ISTA-DASLab が Qwen3.8-Flash-Next の非一律量子化 GGUF モデル群(Q2_0、IQ2_XS、IQ3_XXS、IQ3_S)および BF16 のビジョンプロジェクタを公開した。
- Qwen3.8-Flash-Next は 48 層・512 エキスパートのスパース MoE であり、1 トークンあたり 10 エキスパートがアクティブになる構造を持つ。
- モデルは 2 つのシャードに分割されており、第 1 シャードにはトランスフォーマーウェイト、第 2 シャードには 51.2B パラメータの n-gram 埋め込みテーブルが格納されている。
- 検索ベースの Riemannian 最適化(RCO)により、ファイル全体ではなくテンソルごとに異なる量子化ビット幅を割り当てる非一律量子化を実現した。
2. 影響(Why)
- メモリ削減と推論速度の両立: 一律量子化で発生する精度低下や特定のデコード遅延を抑え、Q2_0 では IQ2_XS 比で 3.4x のプロンプトスループットと 1.9x のレイテンシ短縮を実現した。
- ローカルハードウェアへの適応: 第 2 シャードの n-gram テーブルを SSD 上に保持してディスクから直接読み込ませる mmap 運用により、VRAM から最大 28.8 GB の常駐フットプリントを削減できる。
3. 根拠・詳細(How)
- GSQ および RCO による非一律割り当て: 各テンソルを GSQ で個別に低ビットスカラー量子化し、全体サイズ予算の下で RCO(Riemannian Manifold optimization)を用いて各層・テンソルに最適な量子化クラスを割り当てた。
- llama.cpp によるメモリマップ運用: llama-cli 実行時に -lm mmap --lazy-mode on を指定することで、第 2 シャードの巨大な n-gram 参照テーブルをメモリ上にロードせずディスクから直接遅延読み込みする。
4. 展望・課題(Next)
- コード特化型モデルの検証: コードタスクに特化した 256 エキスパート構成の Qwen3.8-Flash-Next-GSQ-RCO-Coder(58.4 GB)との性能比較と実環境でのコード生成ベンチマーク検証が進められる。