🧠Research🔥🔥

Apple、LLM の生成長を制御するモデル「LenVM」を公開──推論コストと精度の最適化を実現

各トークン生成時に残りの長さを予測し、7B モデルで LIFEBench の長一致精度を 30.9 から 64.8 へ向上させた。
リリース: 2024-11-19 · 読了 3

記事の要約

1. 核心(What)

  • Apple がトークン単位で生成長を予測・制御するフレームワーク「LenVM」を発表。
  • 生成長を価値推定問題として定式化し、各トークンに負の報酬を割り当てることで、アノテーション不要の教師信号を生成。
  • 7B パラメータモデルに適用した結果、LIFEBench の長一致スコアが 30.9 から 64.8 へ向上。
  • GSM8K において 200 トークンの予算制限下で、ベースラインの 6% に対して 63% の精度を維持。

2. 影響(Why)

  • 推論コストの動的制御: 推論コストと回答精度のトレードオフを、プロンプト境界で動的に制御可能。予算制限が厳しいエッジデバイスや API 課金モデルの運用において、トークン消費を最適化できる。
  • 国内 SaaS 事業者への影響: [国内 大規模チャットボット SaaS 業種] のような事業者は、トークン消費量を予測値に基づいて制限することで、API コストの予測可能性を大幅に高められる。

3. 根拠・詳細(How)

  • 価値推定による定式化: 各生成ステップで残りの生成長を割引報酬として予測。LIFEBench ベンチマークにおいて、既存のクローズドソースモデルを上回る長一致精度を実証した。

4. 展望・課題(Next)

  • RL 訓練への統合: 生成長を明示的な価値信号として扱うことで、強化学習(RL)の訓練プロセスにおける報酬関数への組み込みが検討されている。