Apple、LLM の生成長を制御するモデル「LenVM」を公開──推論コストと精度の最適化を実現
各トークン生成時に残りの長さを予測し、7B モデルで LIFEBench の長一致精度を 30.9 から 64.8 へ向上させた。
リリース: 2024-11-19 · 読了 3 分記事の要約
1. 核心(What)
- Apple がトークン単位で生成長を予測・制御するフレームワーク「LenVM」を発表。
- 生成長を価値推定問題として定式化し、各トークンに負の報酬を割り当てることで、アノテーション不要の教師信号を生成。
- 7B パラメータモデルに適用した結果、LIFEBench の長一致スコアが 30.9 から 64.8 へ向上。
- GSM8K において 200 トークンの予算制限下で、ベースラインの 6% に対して 63% の精度を維持。
2. 影響(Why)
- 推論コストの動的制御: 推論コストと回答精度のトレードオフを、プロンプト境界で動的に制御可能。予算制限が厳しいエッジデバイスや API 課金モデルの運用において、トークン消費を最適化できる。
- 国内 SaaS 事業者への影響: [国内 大規模チャットボット SaaS 業種] のような事業者は、トークン消費量を予測値に基づいて制限することで、API コストの予測可能性を大幅に高められる。
3. 根拠・詳細(How)
- 価値推定による定式化: 各生成ステップで残りの生成長を割引報酬として予測。LIFEBench ベンチマークにおいて、既存のクローズドソースモデルを上回る長一致精度を実証した。
4. 展望・課題(Next)
- RL 訓練への統合: 生成長を明示的な価値信号として扱うことで、強化学習(RL)の訓練プロセスにおける報酬関数への組み込みが検討されている。