harshatheg、推論高速化モデル Qwen-2.5-1B-RLCD を公開──Apple Silicon で 5.6x の遅延削減を実現
Apple Silicon 上でマルチフィールド JSON スキーマを並列評価し、標準の逐次デコード比で 5.6x から 7.0x のレイテンシ削減と 100% のスキーマ妥当性を達成する推論エンジン。
リリース: 2026-09-16 · 読了 3 分記事の要約
1. 核心(What)
- Apple Silicon M4 Max 環境において、標準的な自己回帰デコード比で 5.6x から 7.0x のレイテンシ削減を記録した。
- マルチフィールドの JSON スキーマを同時に評価し、スキーマ妥当性 100% とフィールドごとの確信度スコア算出を両立する。
- mlx-community/Qwen2.5-1.5B-Instruct-4bit モデルを用いて macOS Sequoia 上で検証されている。
- サポート対象は Apple Silicon Mac (M1、M2、M3、M4 シリーズ)、macOS 14.0 以降、Python 3.10+ となっている。
2. 影響(Why)
- 構造化抽出のレイテンシを半減: JSON などの構造化データ抽出で必須だった数日・数百回の逐次フォワードパスを 1 回に集約できるため、リアルタイム応答が求められるローカル AI アプリの UX を一変させる。
- ローカル LLM アプリ開発への実務インパクト: 国内のオンデバイス AI 開発を手がけるモバイルアプリ受託開発企業などは、クラウド API に依存せず Apple Silicon 上で高速かつ安全な JSON 出力パイプラインを構築できる。
3. 根拠・詳細(How)
- KV キャッシュブロードキャストとロジットスライシング: コンテキスト文書とスキーマ記述を 1 度プリフィルした KV キャッシュを複数フィールドに並列ブロードキャストし、有効なスキーマ候補のトークン ID のみをサブボキャブラリ単位でロジットスライシングして処理する。
- ベンチマーク検証結果: Fintech 詐欺検知プリセット(4 フィールド)では自己回帰の 421.3 ms に対し 74.8 ms(5.6x 高速)、サポートトリアージ行列(28 フィールド)では 1894.2 ms に対し 268.4 ms(7.1x 高速)を記録した。
4. 展望・課題(Next)
- 対応スキーマの拡張予定: enum 型で最大 255 選択肢をサポートする高カーディナリティフィールドの処理効率維持に向けた検証が続けられている。