CompactifAI、効率的知識蒸留手法 Efficient Knowledge Distillation を公開──オフライン Top-K キャッシュと Fused Chunked KL Loss で VRAM を 15.6 倍削減
教師モデルの Top-K ログits キャッシュと出力投影を融合したメモリ効率型 KL Loss により、32K 長文脈の蒸留コストを複数ノードから単一 GPU へ圧縮した。
リリース: 2026-08-10 · 読了 4 分記事の要約
1. 核心(What)
- 教師モデルの出力分布を 1 度だけ計算して Top-100 のログits をキャッシュするオフライン蒸留方式を導入した。
- 語彙数 × シーケンス長のマトリクスを全展開せずに計算するメモリ効率型 KL-divergence loss(Fused Chunked KL Loss)を実装した。
- モデルの出力投影を損失計算に直接融合させ、生徒モデルのフルログits グリッドの生成を回避する仕組みを構築した。
2. 影響(Why)
- 長文脈蒸留のハードウェア敷居が低下: 1M トークン級や 32K 長文脈の知識蒸留を数百基の GPU から単一の H200 GPU 構成へ落とし込めるため、中小規模の開発チームでも自社特化型モデルの軽量化が現実解になる。
- 国内 SaaS のモデル最適化コストを圧縮: オープンソース LLM を社内 RAG 向けにファインチューニング・圧縮している国内 Vertical SaaS 事業者は、複数ノードのインフラ費用を削りつつドメイン特化型軽量モデルを構築できる。
3. 根拠・詳細(How)
- Top-100 キャッシュによるオフライン化: 教師モデルの推論を学習ループごとに回すのではなく、各トークン位置の Top-100 最尤トークンを事前キャッシュし、教師モデルをメモリ常駐させずに学習する。
- Fused Chunked KL Loss の実装仕様: 隠状態からログitsへの投影を順伝播・逆伝播で 2 回実行しつつ、シーケンスをチャンク単位で逐次処理・破棄することで、ピークメモリの増加を語彙数依存から線形スケールへ抑える。
4. 展望・課題(Next)
- オープンソースでの公開と検証: 実装コードは CompactifAI のリポジトリにて公開されており、今後はさらなる長文脈(256K 超)におけるスケーラビリティの検証が続けられる予定。