mstrasser、推論サーバー Jeff を公開──0.8B/2B の超小型モデルでゼロショット判定を 22 ms 高速化
Qwen3.5 と Gemma 4 をベースにした 0.8B/2B の超小型判定モデル Jeff を公開し、クラウド GPU 不要で 22 ms の高速ゼロショット分類を実現した。
リリース: 2026-09-28 · 読了 3 分記事の要約
1. 核心(What)
- Qwen3.5 と Gemma 4 をベースにした超小型のゼロショット判定モデル Jeff-0.8B/2B を公開
- 入力テキストと選択肢のリストから、単一のフォワードパスで各オプションの確率値をキャリブレーション付きで返す
- RTX PRO 6000 で約 22 ms、Apple M4 Max の MLX バックエンドで約 28 ms の処理速度を実現
- 5つの公開ベンチマークにおいて、Jeff-Qwen3.5-2B が 83.1 を記録し、Jev の公開数値を上回る性能を証明
2. 影響(Why)
- テキスト生成を排除した超高速応答: 自由記述の生成やパース処理を省き、選択肢ごとの確率をダイレクトに返す設計により、30 ms 未満のレイテンシとシステム 1 処理に特化した組み込み性を両立している。
- クラウドレスな学習と運用コストの圧縮: RTX PRO 6000 1基で 0.8B モデルを約 2 時間で学習できるため、高価なクラウド GPU を使わずにドメイン特化のファインチューニングを自社内で完結できる。
3. 根拠・詳細(How)
- Jev 互換の軽量サーバーと対応環境: Python ベースの `jeff-serve` により `JEFF_CHECKPOINT` を指定して起動可能であり、Apple Silicon 向けには MLX バックエンドを `uv sync --extra mac` で利用できる。
- 3つの質問タイプと出力仕様: 最大 255 選択肢の `choice`、Yes/No 確率を返す `noul`、指定スケールの数値点を返す `score` の 3 種類の質問形式を 1 リクエストで同時処理する。
4. 展望・課題(Next)
- 高度な推論タスクでの限界: BBH や JudgeBench などの推論を要するベンチマークでは大型モデルに及ばないため、複雑な文脈理解が必要な用途では追加のファインチューニングや役割分担設計が不可欠。