🧠Research🔥🔥

Cloudflare、意思決定モデル Clef を公開──38ms の高速化と型付きスキーマでエージェント制御を最適化

Qwen 系ベースの Apache 2.0 モデルにより、テキストパース不要で型付きの決定確率を非自己回帰で一括出力し推論遅延を削減する。
リリース: 2026-10-02 · 読了 3 分

記事の要約

1. 核心(What)

  • Cloudflare は Qwen3.8-27B と Qwen3.5-9B をベースとした意思決定モデル Clef および Clef-flash を公開した。
  • モデルはテキスト生成を行わず、非自己回帰の 1 パスで型付きスキーマに対する確率分布を直接出力する。
  • Decision Index 0.2.1 評価において Clef-flash の中央値レイテンシは 38.8 ms を記録した。
  • リクエストごとに質問スキーマを動的に変更できるため、ラベル追加時の再学習が不要である。

2. 影響(Why)

  • パース処理レスによる遅延削減: フリーテキストの生成とパースを排除することで、エージェントの決定プロセスにおけるレイテンシを劇的に短縮しリアルタイム応答を実現する。
  • 国内 SaaS のエージェント実装コスト抑制: 国内のコンタクトセンター向け自動化ツール開発企業は、高価な汎用 LLM を経由せず高速な判断モデルを VPC 内で運用可能になる。

3. 根拠・詳細(How)

  • 非自己回帰による確率の一括出力: noul、choice、score の 3 種類の質問型スキーマを受け取り、許可された全オプションに対する確率を 1 回のフォワードパスで同時評価する。
  • Workers AI およびローカル実行のサポート: Workers AI でのホストに加え、vLLM、SGLang、Transformers を通じたローカル環境での実行と Jev 互換 API を提供する。

4. 展望・課題(Next)

  • カスタム RL チューニングサービスの提供: AI Gateway のトラフィックを活用して Clef を専門特化させるコンパニオン強化学習ファインチューニングサービスの展開が予定されている。