複数ドラフターを協調させる TreeGraft──LLM 推論を最大 26.6% 高速化するツリー型 Speculative Decoding 手法
異なるコストのドラフターを動的に組み合わせて共有ドラフトツリーを構築し、既存の単一ドラフター方式比で平均 15.1% の高速化を達成した。
リリース: 2026-05-28 · 読了 5 分論文概要
Large Language Model (LLM) の推論処理において、推論速度を改善するための Speculative Decoding(推機的デコーディング)は、軽量なドラフターモデルで仮説トークンを生成し、ターゲットモデルで一括検証する「draft-then-verify」パラダイムを採用している。近年発展しているツリー構造型の Speculative Decoding 手法は、複数の候補パスをツリー状に組織化することで承認されるトークン長を伸ばし、推論を加速させてきた。しかし、既存の手法はすべてのドラフトステップにおいて単一のドラフターモデルを使用するため、「小型ドラフターは高速だがツリー品質が低い、大型ドラフターは高品質だがレイテンシが高い」というトレードオフのジレンマを抱えていた。本論文では、コストの異なる複数のドラフターが協調して共有のドラフトツリーを構築するフレームワーク「TreeGraft」を提案し、6 つのベンチマークと 10 のモデルペアによる実験で、従来の単一ドラフター方式の最適値を平均 15.1%、最大 26.6% 上回る高速化を実証した。

関連研究
Speculative Decoding の分野では、単一の系列を生成する手法から、複数の候補をツリー状に生成する手法へと発展してきた。ツリー構造を用いることでターゲットモデルの並列処理能力を有効活用できる一方、ドラフトツリーの品質と生成コストのバランスを取ることが課題となっていた。既存のマルチモデル活用手法は静的な配分や単純な切り替えに依存しており、ツリー全体の構造を動的かつ非破壊的に拡張するメカニズムを備えていなかった。
新規性と貢献
TreeGraft の最大の新規性は、複数の異なる規模・コストを持つドラフターモデルが単一のドラフトツリーを共同で構築・拡張する仕組みにある。強力なドラフターを用いてスコアの再計算や grafting 位置の再選択、未探索の有望なパスの回収を行うことで、推論コストを抑えつつツリーの品質を大幅に高めた点に学術的・実用的な貢献がある。また、軽量なオンラインスケジューラを導入し、呼び出しタイミングを動的に制御する設計も新しい。
提案手法の詳細
TreeGraft は、共有ドラフトツリーの構築において以下のメカニズムを実装している。まず、より強力なドラフターが、軽量なドラフターによって割り当てられたスコアを更新する形で候補の再スコアリングを行い、grafting 位置の再選択や探索漏れしたパスの回収を実施する。さらに、強力なドラフターによる拡張を非破壊的に統合することで、ターゲットモデルによって承認される可能性のある既存のブランチを保持する。これにより、ドラフトツリー全体の品質が最適化される。コスト制御の面では、オフラインの値システムから蒸留された軽量なオンラインスケジューラを導入し、強力なドラフターを呼び出すタイミングを動的に決定する。

評価・考察
6 つのベンチマークと 10 のモデルペアを用いた実験において、TreeGraft は、2 つの固定された単一ドラフター戦略のうち優れた方の性能と比較して、平均で 15.1% の高速化を達成し、最大で 26.6% の改善に到達した。この結果は、動的なマルチドラフターの協調と非破壊的なツリー拡張が、推論レイテンシの削減において極めて有効であることを示している。オンラインスケジューラが適切にコストと品質のバランスを制御していることも確認された。

応用例と今後の展望
LLM のサービングインフラを運用するクラウドサービス事業者や AI スタートアップにおいて、大規模言語モデルの API スループット向上と GPU コスト削減に直接寄与する。特に、数千から数万ユーザーを抱える商用チャットボットや、リアルタイム性が求められるエージェントシステムの実装において、追加の学習コストを抑えつつ推論遅延を削減する基盤技術として実装が進むと見込まれる。今後の課題として、多様なモデル構成や非対称なハードウェア環境におけるスケジューラの一般化が挙げられる。
結論
TreeGraft は、異なるコストのドラフターを動的に組み合わせて共有ドラフトツリーを構築することで、Speculative Decoding のトレードオフを打破する手法である。非破壊的なツリー拡張と軽量なオンラインスケジューラの導入により、大幅な推論高速化を達成しており、今後の LLM 推論最適化の重要なアプローチとなる。
注釈
- Speculative Decoding: 軽量なモデルで複数の予測候補(ドラフト)をすばやく作成し、本命の大規模モデルで一括検証することで推論を高速化する技術。
- Draft Tree: Speculative Decoding において、検証のために生成される複数のトークン候補を木構造に組織化したもの。