Perplexity、エージェント学習基盤モデルを公開──実運用エラーを訓練データ化しツール呼出失敗を 21% 削減
Perplexity が本番環境の失敗トレースをヒント付きセルフ蒸留で学習させる手法を公開し、ライブ A/B テストでツール呼び出し失敗率を相対 21.2% 削減した。
リリース: 2026-09-22 · 読了 3 分記事の要約
1. 核心(What)
- Perplexity は実稼働する Computer agent の成功・失敗セッションを訓練データに変換するポストトレーニング手法を発表した。
- GLM 5.2 の同一チェックポイントを教師と生徒の双方に利用し、ヒントを用いたセルフ蒸留によって修正を内部化する。
- ライブ A/B テスト(各約 10 万ユーザー)において、ルールベースおよび LLM 判定によるツール呼び出し失敗率が相対で 21.2% 低下した。
- ユーザーの不満足率自体には統計的な有意差は見られず、改善は主にツール信頼性に限定された。
2. 影響(Why)
- 本番ログからの効率的学習: 手動による教師データの作成コストを削減しながら、実際のユーザー環境で発生したスキーマ違反や引数エラーを直接モデルに学習させることができる。
- 国内 SaaS への応用価値: 自社で LLM エージェントを運用する国内の業務システム開発企業にとって、失敗トレースを自動で三つのパスに振り分けるアーキテクチャは実装の指針になる。
3. 根拠・詳細(How)
- 3 パスへのルーティング設計: 成功セッションの非エラーターンはクロスエントロピーで模倣させ、検証済みヒントがあるエラーターンは KL ダイバージェンス損失で生徒の分布を教師に近づけ、未検証ターンは文脈としてのみ保持する。
- 同一チェックポイントの二重利用: GLM 5.2 の同一モデルを教師( corrective hint を入力)と生徒(ヒントなしのオリジナル文脈を入力)に使い、教師側の勾配計算をデタッチして次トークン分布を学習させる。
- 時間的グラウンディングの制約: ヒントにはエラー発生時の過去の文脈から導出できる情報のみを許可し、後知恵バイアスを防ぐために事前プレテストで 985 件のホールドアウトターンにおいて検証を実施した。
4. 展望・課題(Next)
- タスク成功率への波及: ツールエラーの削減が必ずしも全体のタスク成功率向上に直結しないという課題に対し、今後はユーザー満足度や最終的なタスク完了率を上げるための追加アライメントが模索される。