🧠Research🔥🔥

Stanford、コントラスト学習モデル CLM-8B を公開──エージェントの意思決定をベクトル検索化し推論を 9 倍高速化

Qwen3-8B のバックボーンを凍結し、状態と行動の双方向エンコーダでツール呼び出しやコンピュータ操作の推論を最大 9 倍に加速した。
リリース: 2026-09-24 · 読了 3 分

記事の要約

1. 核心(What)

  • Stanford の Scaling Intelligence Lab と Hazy Research が、オープンソース(Apache 2.0)のコントラスト学習モデル CLM-8B のリポジトリと重みを公開。
  • 凍結された Qwen3-8B バックボーンと 20M パラメータの射影ヘッドにより、状態と行動のペアを共有ベクトル空間で内積評価して選択。
  • Jev と同等の精度を維持しながら、ツール呼び出しやゲーム、コンピュータ操作のタスクで最大 9 倍の推論高速化を実現。
  • タスク固有のファインチューニング後、DeepSWE で 81.6%、Terminal-Bench 2.1 で 87.6% のスコアを記録。

2. 影響(Why)

  • エージェント構築における推論コストの削減: 逐次的な生成処理に依存していたエージェントのツール選択やルーター処理をベクトル内積検索に置き換えることで、API コストとレイテンシを同時に大幅圧縮できる。
  • 国内エージェント開発組織への適用判断: マルチステップのツール連携を自社システムで運用している [国内 AI エージェント開発企業] 規模のチームは、次期エージェント基盤のルーティング層を生成型から本モデルベースへ移行する検証価値がある。

3. 根拠・詳細(How)

  • 双方向 InfoNCE 損失による 3 段階の学習レシピ: 一致した状態と行動のペアの類似度を高めつつバッチ内の他例との類似度を下げる双方向 InfoNCE 損失を用い、LM を固定した状態で 20M パラメータのヘッドのみを更新。
  • 事前計算によるアクション埋め込みのキャッシュ: 固定されたツール群やインターフェース要素に対するアクションベクトルを事前に計算・キャッシュし、実行時は軽量なベクトル内積演算のみで選択処理を完結させる。

4. 展望・課題(Next)

  • マルチモーダル版 CLM-35B のリリース予定: Hugging Face において、10 月初旬にマルチモーダル対応の CLM-35B チェックポイントの公開が予定されている。