Redis 作者、推論サーバー DwarfStar 4 を公開──DeepSeek V4 や Qwen3.8 をローカル Mac / CUDA で高速稼働
非対称 2bit 量子化と SSD プレフィックスキャッシュにより、M5 Max 128GB 環境で DeepSeek V4.1 Flash を実用速度でローカル実行できる。
リリース: 2026-09-17 · 読了 3 分記事の要約
1. 核心(What)
- Redis の作者が開発した C 言語製のローカル推論エンジン DwarfStar 4 が公開された。
- 非対称 2bit 量子化により、ルーテッドエキスパートを圧縮しつつ重要パスの精度を維持する。
- 長文脈プレフィックスを SSD に保存し、プロンプトハッシュで再開する機能を備える。
- チャット用の ./ds4、ローカル API 用の ./ds4-server、永続コーディング用の ./ds4-agent を単一スタックで提供する。
2. 影響(Why)
- API 依存からの脱却と検証コストの削減: 商用 API に依存せず手元のハイメモリマシンで大規模 MoE モデルを検証できるため、プロトタイプ作成時のコストとレイテンシの制約を排除できる。
- 国内オンプレ環境での大モデル活用: [国内 AI アプリ開発ベンチャー] のような機密データを扱う組織では、VPC やローカル端末内で DeepSeek V4.1 などのフロンティアモデルを動かす現実的な選択肢になる。
3. 根拠・詳細(How)
- 非対称 2bit 量子化によるメモリ削減: MoE の routed experts(ルーテッドエキスパート)部分を 2bit に圧縮し、共有パスの精度を維持することで、高メモリ Mac や CUDA 端末への収容を実現している。
- SSD キャッシュによる再プリフィックス回避: 長文脈のプリフィックスデータを SSD に退避し、プロンプトハッシュで直接レジュームするため、再起動時のフルプリフィックス計算コストが発生しない。
4. 展望・課題(Next)
- ハードウェア要件とモデル対応の拡張: M5 Max 128GB などのハイメモリ環境が前提となるため、より小規模なメモリ環境へのスケーリングや対応モデルの追加が今後の課題となる。