🛠Tools🔥🔥🔥

convaiinnovations、判断モデル Laya を公開──単一フォワードパスで約 33 ms の高速判定

テキストやJSONなどの状態を入力し、型付きの質問に対して数学的確率を伴う回答を約33msの単一フォワードパスで返す多言語非自己回帰型判断モデル。
リリース: 2026-09-18 · 読了 3

記事の要約

1. 核心(What)

  • テキスト、メール、チケットなどの状態データと型付き質問を入力し、数学的に較正された確率を返す非自己回帰型の判断モデル Laya を公開
  • モデルはテキストを一切生成しない設計のため、出力パースの必要がなくハルシネーションが発生しない
  • 英語チェックポイント(ModernBERT-largeベース、421M)および多言語チェックポイント(mmBERT-baseベース、322M)の3つのチェックポイントを提供
  • 内蔵ルーターにより、入力文の言語やスクリプトをサブミリ秒で自動検出し、最適なチェックポイントへルーティング可能

2. 影響(Why)

  • 推論遅延の圧倒的な短縮: 従来の生成型 LLM による判定処理と比較して約 6〜8 倍高速であり、レイテンシ制約の厳しい本番 API で実用的な速度を発揮する。
  • 国内エンタープライズのコスト削減: 大量のチケット分類やルーティングを必要とする国内のコンタクトセンター向けシステムにおいて、GPU リソースの消費を最小限に抑えた運用が可能になる。

3. 根拠・詳細(How)

  • バックボーンと意思決定ヘッドの構造: ModernBERT-large(395M)に 2 層のトランスフォーマーレイヤー、オプションマーカースコアラー、act/escalate ヘッドを結合したアーキテクチャを採用。
  • RLCD による確率較正: 厳密な適切なスコアリングルールを用いた強化学習(RLCD)により報酬を最大化し、ドメイン温度フィッティング適用後に ECE 0.081 を達成。

4. 展望・課題(Next)

  • 大規模選択肢への対応: 50 以上の高カーディナリティな選択肢を扱う場合には、agent.cfg["head_max_len"] の拡張や段階的な階層的選択への分割が必要となる。