LLMのサブリミナルプロンプティングにおける因果的深さとマルチトークン交絡の検証──Llama-3.1でドナー制御AUCが最大+0.286向上
固定された幾何学的特徴量や出力表現が隠れた特性の伝達を予測しないことを示し、因果的タイミングとマルチトークン計測の分離を実証した。
リリース: 2026-07-20 · 読了 5 分論文概要
サブリミナル学習における、言語モデルが出力から無関係に見える隠れた特性を伝達する現象について検証した論文。著者であるBarath Velmuruganは、Llama-3.1-8Bから70Bまでのモデルを用いた動物-数値のプロンプティングプロトコルを通じ、静的ジオメトリ、観察可能なリードアウト、因果的タイミング、マルチトークン計測がそれぞれ独立した特性であることを示した。固定された出力ベクトルの類似度は行動を十分に予測できず、ペアワイズ平均相関変化は-0.080(95% CI [-0.127, -0.035])であることを報告している。
関連研究
従来、トークンエンタングルメントなどの仮説により、モデルの出力語彙を通じて動物と数値のトークンが結び付けられることが議論されてきた。しかし、既存の計測手法は「出力が共変動するか」「固定された出力ベクトルが整列しているか」「隠れ状態から答えが読み出せるか」「その状態が答えを因果的に制御しているか」という異なる問いに混同して答えていた。本研究は、これらを分離して個別に測定するアプローチをとる。
新規性と貢献
本研究の主要な貢献は、プロンプティングチャネルにおける「固定ジオメトリ」「観察可能性」「因果的タイミング」「マルチトークン測定」が明確に区別されるべき異なるプロパティであることを実証した点にある。
これにより、トークンレベルの既存の説明に対する制約が明らかになった。
提案手法の詳細
検証では、固定された動物-数値のプロンプティングプロトコルを設計した。因果関係をテストするため、一時的な回答位置の状態を5つの深さで1つの数値プロンプトから別のプロンプトにコピーし、最終的な動物スコアがどちらのプロンプトに従うかを測定している。
このドナー制御AUCは0.254から0.540へと、ペアワイズで+0.286(95% CI [+0.272, +0.300])上昇し、18すべての概念で増加が確認された。
評価・考察
実験結果から、固定出力ベクトルの類似度は行動の予測に寄与しないことが示された。また、2つのQwenモデルを用いた検証では、すべての桁を順番にスコアリングしても正の1トークン関連性は回復せず、パー・トークン平均化がかえって正のプールされた関連性を生み出し、数値幅を制御するとそれが消失するという長さ交絡が存在することが判明した。
応用例と今後の展望
本研究の知見は、LLMの内部表現解釈や安全性の検証において、単なる静的なベクトルの類似度や表面的なトークン相関に基づく解釈の限界を示すものである。自然言語処理のセキュリティやアライメント研究分野における、約1,000〜10,000パラメータ規模のモデル分析やメカニスティック・インタプリタビリティの研究に対して、因果関係と観測可能性を分離して評価する厳密な検証フレームワークを提供する。
結論
固定幾何学、観察可能な読み出し、因果的タイミング、マルチトークン測定はすべて凍結されたプロンプティングチャネルにおける異なる特性である。これらはトークンレベルの説明を制約する一方で、トレーニング時の特性伝達のメカニズムそのものを特定するには至らないという結論を提示している。
注釈
- サブリミナルプロンプティング: 表向きの出力構造とは異なる隠れた特性や情報をモデル間で伝達する現象。
- ドナー制御AUC: あるプロンプトの内部状態(ドナー)を別のプロンプトに転写した際に、出力への影響力を測るための指標。