PostHog、推論特化型意思決定モデル Jeeves を公開──JevBench 公開階層で 0.935 を記録
Qwen3.5-9B をベースに LoRA とポインタヘッドを統合し、決定前の推論プロセスにより out-of-domain の精度を 0.889 へ引き上げた。
リリース: 2026-09-29 · 読了 3 分記事の要約
1. 核心(What)
- PostHog は 2026 年 9 月、決定前に推論を行う 9B パラメータの意思決定モデル Jeeves をオープンソースで公開した。
- テスト全体のスコア(out-of-domain および held-out、item-weighted)で 0.889 を記録し、既存の Kev-9B(0.822)および Jev(0.857)を上回った。
- JevBench の公開階層(231 項目)において、Jeeves は 0.935 のスコアを達成し、Jev の 0.866 を超える性能を示した。
- H100 GPU 単体環境において、推論オフ時は約 0.3 秒、推論オン時は中央値 3.3 秒でリクエストを処理する。
2. 影響(Why)
- 意思決定モデルの精度底上げ: 従来の Jev 型モデルは較正された確率を出力する一方で精度が低かったが、事前推論を挟む設計により out-of-domain タスクでも高い識別性能を維持できる。
- 国内 SaaS 事業者への影響: カスタマーサポートの自動ルーティングやトーン判定を自社インフラ(VPC 内)で高精度に実装したい国内 SaaS 企業にとって、商用 API に依存しない選択肢となる。
3. 根拠・詳細(How)
- モデル構造とトレーニング: Qwen3.5-9B をベースに LoRA とポインタヘッドを適用し、ブロック 4 の拡散ドラフターおよび CISPO(Contrastive Policy Optimization)を用いて事前学習を実施した。
- サービングと API 仕様: Python 3.12 と CUDA(Hopper アーキテクチャの FP8 カーネル)に対応し、Jev 互換の /v1/systemone エンドポイント経由で yes/no、多肢選択、スコア評価を単一リクエストで処理する。
4. 展望・課題(Next)
- 実運用における遅延最適化: チェーン長を動的に切り捨てることでレイテンシを短縮する調整が可能であり、本番システムのリアルタイム要件に向けた検証が進められる。