🛠Tools🔥🔥🔥

Prism ML、推論サーバー向け 1-bit 量子化モデル Bonsai-27B-gguf を公開──27B クラスの reasoning を 3.9 GB で実現

Qwen3.6-27B をベースに重みあたり 1.125 ビットへ圧縮した binary transformer weights を実装し、商用クラスの知性をローカル環境で稼働させる。
リリース: 2026-07-15 · 読了 4

記事の要約

1. 核心(What)

  • Prism ML は、Qwen3.6-27B をベースにエンベッドから LM ヘッドまでを完全なバイナリ重み(1.125 ビット/重み)で表現した Bonsai-27B-gguf を公開した。
  • GGUF Q1_0_g128 フォーマットを採用し、128 重みごとに 1 つの FP16 スケールファクターを共有することで、極限までの省メモリ化と精度維持を両立している。
  • Apple Silicon 向けに Bonsai-27B-mlx-1bit が同時提供され、iPhone 17 Pro Max などのモバイル端末でも約 11 tok/s での動作を確認している。
  • CUDA および Metal に対応した llama.cpp 用のカスタム低ビットカーネルや、ロスレスな推論高速化を実現する DSpark ドラfter 層が同梱されている。

2. 影響(Why)

  • 低ビット量子化における性能崩壊の克服: 従来の 2 ビット未満の量子化では数学やコーディング能力が著しく低下していたが、本モデルは AIME や LiveCodeBench などの推論タスクで性能を維持し、実用的な水準を死守している。
  • ローカルハードウェアの制約打破: 約 54 GB 必要だった FP16 版の重みを 3.9 GB まで圧縮したことで、ハイエンドな datacenter GPU がない一般的な開発端末でも 27B モデルのローカル実行が現実解になる。

3. 根拠・詳細(How)

  • ハイブリッドアテンションと Q1_0_g128 レイアウト: Qwen3.6-27B の約 75% 線形アテンション構造を活かしつつ、カスタム 1 ビットカーネルが packed された重みを展開せずに直接消費することでメモリ帯域のボトルネックを解消する。
  • DSpark 推測デコーディングによる高速化: 6 層のブロック並列トランスフォーマーで構成された軽量ドラfter を採用し、ターゲット分布を完全に保存したまま CUDA パス上で 1.37x のエンドツーエンドのデコード高速化を達成している。

4. 展望・課題(Next)

  • モバイルおよびエッジ端末への展開拡大: MLX Swift ランタイムを活用した iOS/macOS 向けのネイティブ推論検証が進められており、今後はエッジデバイス特有の電力消費とスループットの最適化が焦点となる。