convaiinnovations、判断モデル Laya を公開──単一フォワードパスで約 33 ms の高速判定
テキストやJSONなどの状態を入力し、型付きの質問に対して数学的確率を伴う回答を約33msの単一フォワードパスで返す多言語非自己回帰型判断モデル。
リリース: 2026-09-18 · 読了 3 分記事の要約
1. 核心(What)
- テキスト、メール、チケットなどの状態データと型付き質問を入力し、数学的に較正された確率を返す非自己回帰型の判断モデル Laya を公開
- モデルはテキストを一切生成しない設計のため、出力パースの必要がなくハルシネーションが発生しない
- 英語チェックポイント(ModernBERT-largeベース、421M)および多言語チェックポイント(mmBERT-baseベース、322M)の3つのチェックポイントを提供
- 内蔵ルーターにより、入力文の言語やスクリプトをサブミリ秒で自動検出し、最適なチェックポイントへルーティング可能
2. 影響(Why)
- 推論遅延の圧倒的な短縮: 従来の生成型 LLM による判定処理と比較して約 6〜8 倍高速であり、レイテンシ制約の厳しい本番 API で実用的な速度を発揮する。
- 国内エンタープライズのコスト削減: 大量のチケット分類やルーティングを必要とする国内のコンタクトセンター向けシステムにおいて、GPU リソースの消費を最小限に抑えた運用が可能になる。
3. 根拠・詳細(How)
- バックボーンと意思決定ヘッドの構造: ModernBERT-large(395M)に 2 層のトランスフォーマーレイヤー、オプションマーカースコアラー、act/escalate ヘッドを結合したアーキテクチャを採用。
- RLCD による確率較正: 厳密な適切なスコアリングルールを用いた強化学習(RLCD)により報酬を最大化し、ドメイン温度フィッティング適用後に ECE 0.081 を達成。
4. 展望・課題(Next)
- 大規模選択肢への対応: 50 以上の高カーディナリティな選択肢を扱う場合には、agent.cfg["head_max_len"] の拡張や段階的な階層的選択への分割が必要となる。