🛠Tools🔥🔥

Redis 作者、推論サーバー DwarfStar 4 を公開──DeepSeek V4 や Qwen3.8 をローカル Mac / CUDA で高速稼働

非対称 2bit 量子化と SSD プレフィックスキャッシュにより、M5 Max 128GB 環境で DeepSeek V4.1 Flash を実用速度でローカル実行できる。
リリース: 2026-09-17 · 読了 3 分

記事の要約

1. 核心(What)

  • Redis の作者が開発した C 言語製のローカル推論エンジン DwarfStar 4 が公開された。
  • 非対称 2bit 量子化により、ルーテッドエキスパートを圧縮しつつ重要パスの精度を維持する。
  • 長文脈プレフィックスを SSD に保存し、プロンプトハッシュで再開する機能を備える。
  • チャット用の ./ds4、ローカル API 用の ./ds4-server、永続コーディング用の ./ds4-agent を単一スタックで提供する。

2. 影響(Why)

  • API 依存からの脱却と検証コストの削減: 商用 API に依存せず手元のハイメモリマシンで大規模 MoE モデルを検証できるため、プロトタイプ作成時のコストとレイテンシの制約を排除できる。
  • 国内オンプレ環境での大モデル活用: [国内 AI アプリ開発ベンチャー] のような機密データを扱う組織では、VPC やローカル端末内で DeepSeek V4.1 などのフロンティアモデルを動かす現実的な選択肢になる。

3. 根拠・詳細(How)

  • 非対称 2bit 量子化によるメモリ削減: MoE の routed experts(ルーテッドエキスパート)部分を 2bit に圧縮し、共有パスの精度を維持することで、高メモリ Mac や CUDA 端末への収容を実現している。
  • SSD キャッシュによる再プリフィックス回避: 長文脈のプリフィックスデータを SSD に退避し、プロンプトハッシュで直接レジュームするため、再起動時のフルプリフィックス計算コストが発生しない。

4. 展望・課題(Next)

  • ハードウェア要件とモデル対応の拡張: M5 Max 128GB などのハイメモリ環境が前提となるため、より小規模なメモリ環境へのスケーリングや対応モデルの追加が今後の課題となる。