LG AI Research、言語モデル EXAONE 3.5 7.8B AWQ を公開──Hugging Face で月間 100 万ダウンロード目前、5GB VRAM でローカル動作
4-bit W4A16g128 量子化によりバイリンガル対応の 7.8B モデルを 5GB VRAM へ収めつつ、32,768 トークンの長文脈処理を維持している。
リリース: 2026-09-27 · 読了 3 分記事の要約
1. 核心(What)
- LG AI Research が開発したバイリンガル対応モデル EXAONE 3.5 7.8B AWQ が Hugging Face で月間 100 万ダウンロードに接近している。
- 4-bit W4A16g128 量子化により、モデルウェイトの容量を約 5GB の VRAM に圧縮することに成功した。
- グループ化アテンション機構を採用し、最大 32,768 トークンのコンテキストウィンドウと 102,400 語のボキャブラリーを保持している。
2. 影響(Why)
- ローカル検証のハードルが低下: 5GB の VRAM で動くため、コンシューマー向け GPU でも 7.8B クラスのバイリンガルモデルを手元で高速に検証できる。
- 国内ローカライズ検証への影響: [国内 AI 受託開発企業] のような中規模ベンダーは、クラウド API に依存しないオンプレミス検証のベースラインとして比較検討に組み入れる価値がある。
3. 根拠・詳細(How)
- W4A16 量子化の仕様: ウェイトを 4-bit 精度で保持しつつアクティベーションは 16-bit を維持。128 ウェイト単位で量子化メタデータを共有するグループ化方式を採用している。
- 長文脈対応のアーキテクチャ: ロータリー位置埋め込みの theta を 1,000,000 に設定し、事前学習から長文脈ファインチューニングを経て 4,096 から 32,768 トークンへ拡張。
4. 展望・課題(Next)
- 商用利用のライセンス確認: 研究目的向けの EXAONE 1.1 NC ライセンスが適用されているため、商用展開時は LG AI Research への直接問い合わせが必要。