Multiverse Computing、物理モデル応用 LLM 圧縮アーキテクチャ LLM Compression by Block Removal を発表──Llama-3.3-70B の 50% 圧縮時 MMLU で 23 ポイント向上
トランスフォーマーブロックの削除最適化問題を Ising モデル(スピン系)に帰着させ、二次テイラー展開によるブロック間カップリングを考慮することで、深部圧縮における性能劣化を大幅に抑制した。
リリース: 2026-09-21 · 読了 4 分記事の要約
1. 核心(What)
- Llama-3.3-70B-Instruct を 50% 圧縮(80ブロック中 40ブロック削除)した際、従来最高の手法と比較して MMLU スコアで約 23 ポイントの向上を達成した。
- ブロック削除の組み合わせ最適化問題を Ising ガラス(全結合スピン系)にマッピングし、二次テイラー展開による Hessian 行列の非対角成分からブロック間の相互作用(カップリング)を定量化した。
- 1,100 人コホートの代わりに、小さな校正データセットを用いた 1 回のフォワード・バックワードパスで Hessian を計算し、数式ベースの安価なエネルギー評価で数兆通りの構成を探索可能にした。
- Llama-3.1-8B-Instruct、Qwen3-14B、Llama-3.3-70B-Instruct の各モデルにおいて、特に高圧縮領域(全体の 30〜50% 削除)で従来の手法を大きく上回るベンチマーク結果を示した。
2. 影響(Why)
- 巨大モデルのオンプレミス軽量化に直結: 70B 級の超巨大モデルを単一 GPU 圏内に収めるためのプルーニングにおいて、従来手法で発生していた急激な精度崩壊を防げるため、商用環境での推論コストを半減させる実用的な選択肢になる。
- 国内 SaaS 事業者のモデル運用コスト削減: 商用 API への依存度を下げて自社インフラ(VPC)上で独自モデルを運用したい国内生成 AI ベンダーや中規模 SaaS 事業者は、ベースモデルを 50% 圧縮しても性能を維持できる本手法を量子化の有力な代替として評価すべき段階に来た。
3. 根拠・詳細(How)
- Ising ガラスモデルと結合変数の導入: 各トランスフォーマーブロックに二値変数(0:維持、1:削除)を割り当て、損失関数の二次テイラー展開から得られる Hessian の非対角成分をブロック間の相互作用として定式化。削除対象のブロック数を保存磁化とする保存系 Ising スピンとしてエネルギー最小化問題を解く。
- 量子インスピレーションソルバーの適用: 構成空間が爆発するケースでは、総当たり探索を打ち切り、QUBO 形式に変換した上で量子アニーリングや QAOA、tabu search などの最適化ソルバーを活用して数秒で低エネルギー状態を導出する。
4. 展望・課題(Next)
- 異種混合アーキテクチャへの拡張検証: 異なるブロックタイプが複雑にインターリーブされた最新の異種混合モデルに対しても、Ising 構造による定式化がそのままスケールするかどうか、さらなる検証が進められている。