ukisai、ローカルモデル ランナー Swift-Qwen3.8-27B-GGUF を公開──思考トークン 58.3% 削減と 1.95 倍高速化を実現
Qwen3.8-27B の推論プロセスを効率化した GGUF 版モデルであり、思考トークン数を半減させながら 1.95 倍の高速化とメモリ削減を両立する。
リリース: 2026-09-11 · 読了 3 分記事の要約
1. 核心(What)
- ukisai は Qwen3.8-27B の派生モデルである Swift-Qwen3.8-27B-GGUF を Hugging Face で公開した。
- 思考トークン数をベースモデル比で 58.3% 削減し、特定タスクで 1.95 倍の速度向上を達成した。
- モデル構造は 64 ブロックのうち 16 ブロックがフルアテンションであり、KV キャッシュは 1 トークンあたり 64 KiB に抑えられている。
- llama.cpp、vLLM、Ollama などのランナーに対応し、マルチモーダル用プロジェクターや MTP(Multi-Token Prediction)レイヤーも同梱されている。
2. 影響(Why)
- ローカル推論のコスト効率を刷新: 長文脈や推論重視のタスクでネックになる思考トークン量を大幅に削減できるため、単一 GPU 環境でのローカル LLM 運用コストを大きく引き下げる選択肢になる。
- 国内 SaaS のコスト最適化への直結: [国内 AI アプリケーション開発業種] のような中規模事業者は、推論時のトークン消費量を削減することで API コストやローカル GPU のハードウェア要件を直接圧縮できる。
3. 根拠・詳細(How)
- 推論トークンのペナルティ調整: Qwen の思考ロールアウトで過剰な思索を引き起こすマーカートークンを特定し、推論時にその使用をペナルティ化するファインチューニングを施している。
- 専用の量子化レシピと MTP 統合: llama.cpp release b10896 をベースに、ssm_alpha や ssm_beta を F32 に、MTP ヘッドを Q8_0 にピン留めするカスタム重要度マトリクスと量子化レイアウトを採用している。
4. 展望・課題(Next)
- ベンチマークの再検証予定: 公開された GGUF 版におけるマルチモーダル生成や完全なベンチマークスイートの再評価はまだ実施されていない。