Inception、構造化判断モデル Mercury Decide を公開──推論速度 14 決定/秒と出力トークン無料化を実現
テキスト生成の代わりに確率付きの型付き回答を返す専用エンドポイントを提供し、AI ルーティングやトリアージの実装コストを劇的に下げる。
リリース: 2026-09-30 · 読了 3 分記事の要約
1. 核心(What)
- 構造化された判定結果と確率を返すホステッドモデル Mercury Decide が発表された。
- 状態、質問、ルーブリック(評価基準)を組み合わせて 1 回のリクエストで送信する。
- チャット互換ではなく、専用の /v1/systemone エンドポイント経由で利用する。
- JevBench において優位性を示しているとされる。
2. 影響(Why)
- JSON パースの廃止による実装の簡素化: 自由記述の生成や JSON パースの失敗に悩まされることなく、型付きの選択肢・スコア・Yes/No を直接受け取れるため、エージェントシステムの信頼性が向上する。
- コスト構造の根本的な改善: 内部の確率分布から直接出力を抽出するため出力トークンが無料となり、毎秒多数のリクエストが発生するルーティングやモデレーションの運用費を圧縮できる。
3. 根拠・詳細(How)
- 拡散言語モデルによる並列処理: Mercury 2.5 と同じ拡散モデルアプローチを採用し、オートレグレッシブモデルのように 1 トークンずつ直列生成するのではなく複数位置を並列処理する仕組みをとる。
- OpenRouter 経由の専用エンドポイント: チャット API とは完全に分離された /v1/systemone エンドポイントを提供し、単一プロバイダーによるホスティングと 33K トークンのコンテキストを処理する。
4. 展望・課題(Next)
- 較正(Calibration)の検証が必要: 出力される確率値が実際の正答率と一致しているかのキャリブレーションを確認し、プロダクション環境ごとの閾値チューニングを行う必要がある。