🧠Research🔥🔥🔥

AutoTrust、適応型思考モデル GEV-26B-Decide を公開──Gemma-4 ベースの意思決定最適化

Gemma-4-26B をベースに System 1 と System 2 を動的に切り替えるオープンウェイトの意思決定モデル。不確実性が高い場合のみ思考モードを起動し、推論コストを最適化する。
リリース: 2026-10-02 · 読了 3 分

記事の要約

1. 核心(What)

  • AutoTrust AI は、適応型思考機能を備えた 26B パラメータのオープンウェイト意思決定モデル autotrust/GEV-26B-Decide を Hugging Face に公開した。
  • Gemma-4-26B-A4B-it をベースに、単一の vLLM エンジン上でテキストと画像の双方を処理し、System 1(単一パス)と System 2(思考モード)を動的に切り替える。
  • 予測の最高確率オプションの信頼度が閾値 0.8 未満の場合のみ Gemma-4 の思考モードを作動させ、両者の確率分布を等割合で合成することで過剰な自信を抑制する。
  • 知識・推論領域の 10 ベンチマークで Decision Index スコアが 0.429 から 0.602 へ向上し、特に論理パズル等で顕著な改善を確認した。

2. 影響(Why)

  • コストと精度の動的トレードオフ: 全推論で思考トークンを消費するモデルと異なり、不確実な局面だけ System 2 を起動することで、中央値 13.4 秒のレイテンシと高精度を効率的に両立できる。
  • 国内エージェント開発への実用性: 社内業務プロセス自動化や高度な分類タスクを内製する国内システムインテグレーターにとって、商用 API を使わずに構造化された決定確率を得られるメリットは大きい。

3. 根拠・詳細(How)

  • vLLM と LoRA による統合サービング: Gemma-4 対応の vLLM ビルドに専用パッチ適用後、serve_decide.py を用いて backbone LoRA と decision head をロードし、POST /v1/decide エンドポイントで確率分布と思考メトリクスを出力する。
  • 確率の合成とスレッショルド設計: System 1 の出力 p1 の信頼度が 0.8 を下回る場合に System 2 の出力 p2 を呼び出し、p = ½ p1 + ½ p2 の合成式によって過剰適合を防ぎながらキャリブレーションを維持する。

4. 展望・課題(Next)

  • コンテキスト長とマルチモーダル検証: ネイティブコンテキスト 262,144 トークンにおける長文脈での挙動検証や、視覚タスクにおける精度向上のための追加チューニングが予定されている。