LLMのプロンプト語彙感度を大規模解析──13万件のバリエーションから導いた性能安定性のスケーリング則
13万件を超えるプロンプト変種の解析により、性能向上とロバスト性の関係を解明し、コード生成タスクで分散を40.7%削減する自動洗練エージェントを提案した。
リリース: 2026-06-16 · 読了 5 分論文概要
Large Language Models (LLM) は、表面的なプロンプトのわずかな語彙の変更に対して極めて敏感であり、小さな変化が不釣り合いな性能変動を引き起こすことが知られている。本論文では、ブラックボックス最適化や粗い粒度のテンプレートを超えて、132,000件のプロンプト変種を用いた初の大規模な n-gram トークンレベルの力学的解析を行い、プロンプト安定性に関する「Scaling Law of Prompt Performance Stability(プロンプト性能安定性のスケーリング則)」を提示した。平均的なタスク性能が高いほど、プロンプトの摂動に対する分散が小さく、ロバスト性が高まるという強い相関が確認されている。

関連研究
これまでのプロンプト最適化手法は、主に試行錯誤に基づく手動の調整や、大規模な探索を伴うブラックボックスな手法が主流であった。また、プロンプトのロバスト性を系統的に評価する枠組みは十分に確立されていなかった。本研究は、トークンレベルの n-gram 解析によって語彙感度を定量化し、メカニスティックな視点からプロンプトの安定性を説明する点で既存研究と異なる。
新規性と貢献
本研究の主要な貢献は以下の通りである。第一に、13万件を超えるプロンプト変種を用いた大規模解析により、プロンプト安定性のスケーリング則を実証したこと。第二に、ロバスト性を駆動する言語的要因として「ドメイン固有の用語(Domain-Specific Terminology)」と「明示的な行動指示(Explicit Action Directives)」の2つを特定したこと。第三に、これらの知見に基づき、入力クエリを自動的に再構築する自動プロンプト洗練エージェントを提案し、コード生成タスクで性能分散を40.7%削減したことである。
提案手法の詳細
本研究では、プロンプトの解釈空間を制約し、生成動作をより決定論的に「ロックイン」するためのメカニズムとして、以下の2つの要素を解明した。
- ドメイン固有の用語: 意味的境界をしっかりと固定し、モデルが意図しない解釈をするのを防ぐ。
- 明示的な行動指示: 推論の軌道を形式化し、タスクの実行手順を明確にする。

これらの洞察を元に構築された自動 Prompt-Refining Agent は、ユーザーの入力をシステム的に解析し、ドメインのアンカリングと運用上の制約を動的に注入することで、表現の揺れによる性能低下を防ぐ。
評価・考察
実証実験において、提案する Prompt-Refining Agent はコード生成タスクにおいて性能分散を40.7%削減することに成功した。平均性能を維持あるいは向上させつつ、プロンプトの微小な変更に対する脆弱性を大幅に改善できることが示されている。また、高ロバスト性プロンプトにおける特徴的トークンパターンの対数オッズ比ランキング分析(Figure 5)を通じて、どのような語彙が安定性に寄与するのかがメカニスティックに裏付けられている。

応用例と今後の展望
本手法は、社内システムや受託開発において LLM を組み込む際のプロンプト運用の安定化に直結する。特に、金融・医療などのミッションクリティカルな領域におけるソフトウェア開発や、LLM をバックエンドに持つ自動コード生成パイプラインにおいて、プロンプトの語彙の揺れに起因する品質のバラツキを抑制する実務インパクトを持つ。今後の課題としては、コード生成以外の多様な推論・要約タスクへの拡張や、より多様な言語モデルファミリへの適用検証が挙げられる。
結論
本研究は、LLM のプロンプト語彙感度に関する大規模な定量分析を行い、性能安定性のスケーリング則を明らかにした。ドメイン固有の用語と明示的な行動指示の重要性を解明し、それを組み込んだ自動洗練エージェントによってコード生成の分散を40.7%削減した成果は、経験則に依存しがちなプロンプトエンジニアリングを統計的・力学的に裏付けられたフレームワークへと進化させるものである。
注釈
- n-gram: 文章を連続した n 個の単語や文字に分割して分析する手法。
- プロンプトのロバスト性: プロンプトの表現や語彙が多少変化しても、出力の品質や性能が安定して維持される度合い。