📜Papers🔥🔥

LLM 選好における非推移性を説明する複数潜在選好モデル──単一順序仮説の限界を検証

LLMの選好に生じる非推移性は単一の潜在的順序ではなく複数の内部一貫性を持つ選好の集約に起因することを示し、混合Bradley-Terryモデルにより予測精度が向上することを実証した。
リリース: 2026-08-26 · 読了 5

論文概要

LLMが価値判断や選択を行う際、しばしば「AをBより好み、BをCより好むが、同時にCをAよりも好む」という非推移性(intransitivity)が観測される。これまでの研究では、こうした不整合は単一の潜在的順序の周囲におけるサンプリングノイズとして扱われてきた。本論文では、非推移性は単一の順序ではなく、複数の内部一貫性を持った潜在的選好構造の集約に起因するという仮説を立て、繰り返しペアワイズ比較から潜在的選好成分を推論するノイズ拡張混合Bradley-Terry(MBT)モデルを提案した。7つのモデルと4つのタスクを用いた実験により、複数の順序を仮定する混合モデルが単一ユーティリティモデルよりも構造的な不整合を正確に説明できることを示している。Figure N: LLMの選好における不整合と、MBTモデルによる潜在的選好の復元を示す概念図。

関連研究

LLMのアライメントや選好学習に関する従来の枠組みでは、Bradley-TerryモデルやPlackett-Luceモデルをはじめとする単一の潜在的選好関数を仮定するのが主流であった。しかし、人間社会と同様にモデル自体が多様な文脈や複数の価値観を内包している可能性や、観測される矛盾がサンプリングノイズのみに由来するのかという点についての体系的な検証は十分に行われてこなかった。本研究は、選好モデルの前提そのものを見直し、単一の単調リンク関数では観測された不整合を説明できないことを理論的・実験的に示した点で先行研究と一線を画す。

新規性と貢献

本研究の最大の新規性は、LLMの選好における非推移性が単なるノイズではなく、複数の異なる潜在的順序が混ざり合った結果であると定式化した点にある。単一の順序仮説では任意の単調リンク関数を用いても説明できない構造的不整合が存在することを証明し、それを捉える手法としてMBTモデルを導入した。また、Moral Machineジレンマを用いたケーススタディにより、集約された選好では競合しているように見えるモデル同士でも、背後にある潜在的コンポーネントを共有し得ることが示された。

提案手法の詳細

本研究では、繰り返し行われるペアワイズ比較データから複数の潜在的選好を復元するため、ノイズ拡張混合Bradley-Terry(MBT)モデルを導入した。なぜこの設計を採用したかといえば、単一の確率分布だけでモデルの選択傾向を近似すると、トレードオフの関係にある価値観や異なる判断基準が平均化されてしまい、実際のモデル内部の多様性が隠蔽されてしまうためである。MBTモデルを用いることで、モデルが持つ複数の内部一貫性のある選好コンポーネントを分離し、より忠実に選好構造をモデル化することが可能になる。Figure N: 道徳的ジレンマデータセットにおける強い確率的推移性(SST)の違反と構造的不整合の可視化。

評価・考察

7つのLLMと4つのタスクを用いた検証において、複数の順序を組み合わせたMBTモデルは、平均二乗誤差(MSE)に基づくホールドアウト予測精度において、従来の単一コンポーネント基準を上回る性能を示した。Figure N: 平均二乗誤差(MSE)に基づく、単一コンポーネント基準に対するMBTモデルのホールドアウト予測精度改善。また、Moral Machineのデータセットを用いた分析では、集約された選好だけを見ると異質なモデルが、実は共通する複数の潜在的選好コンポーネントを異なる比率で内包していることが明らかになった。この結果は、既存のアライメント評価が多様なユーザーの価値観の対立やモデル内の複数性を無視して単一の関数として平均化してしまっているリスクを浮き彫りにしている。

応用例と今後の展望

本研究の成果は、多様な価値観を前提とするアライメントパイプラインや、自動評価(LLM-as-a-Judge)の設計に直接的な示唆を与える。例えば、金融機関や医療機関向けのLLM開発において、エンドユーザーの好みが多様である場合、単一の報酬モデルによる最適化は特定の集団の選好を平均化してしまい、現場の厳格な要件を満たさないリスクがある。今後は、本手法を用いてモデル内の潜在的選好を明示的に制御・抽出するアライメント手法の実装が求められる。

結論

本論文は、LLMの選好における非推移性が単なるランダムなノイズではなく、複数の一貫した潜在的順序の集約であることを示した。混合Bradley-Terryモデルを用いた分析により、既存の単一関数に基づく評価パイプラインの限界が指摘されており、今後はLLMが多元的な選好を反映しているという前提に立った評価設計が必要とされる。

注釈

  • 非推移性 (Intransitivity): 「A>BかつB>Cであるにもかかわらず、C>Aとなる」ような、論理的な順序の循環が生じる現象。人間の意思決定やLLMの選好評価で頻繁に観測される。
  • Bradley-Terryモデル: 2つの選択肢のペアワイズ比較からそれぞれの勝率や選好度を確率的に推定するための統計モデル。
  • Moral Machine: 自動運転車の倫理的ジレンマにおける人間の判断を収集するために開発された意思決定データセット。