📜Papers🔥🔥

LLM エージェントによるSNS反応予測手法──完全プロファイル条件で最大 96.68% の精度を実証

12 種類の LLM 構成をベンチマークし、フルプロファイル条件で 96.68% の精度を達成する一方、属性情報のみでは予測信号がほぼ失われることを確認した。
リリース: 2026-06-19 · 読了 6

論文概要

本研究は、ソーシャルメディア上の個人の反応(ライク/ディスライク)を LLM エージェントによりどの程度正確にシミュレーションできるかを検証したものである。296 件のサーベイベースのエージェントプロファイルと 26 件のグラウンドトゥルースにマッピングされた投稿を用い、12 種類の LLM 構成をベンチマークした。その結果、完全なプロファイル条件において、モデル選択に応じて 75.54% から 96.68% の予測精度を達成することが示された。Figure 1: 本研究の全体的なデザインと解析パイプラインを示す手法の概略図。

関連研究

ソーシャルメディア上の世論形成やプラットフォームガバナンスにおける AI エージェントのリスクが議論される中、従来の手法では個人の行動予測において未知の投稿に対する汎化性能が不足していた。本研究では、機械学習による教師あり分類器をベースラインとして設定し、ゼロショットでの汎化性能を比較している。

新規性と貢献

最大の貢献は、プロファイルの完全性が LLM の反応予測精度に与える影響を定量的に明らかにした点である。GPT-5.5 Pro の精度はフルプロファイルの 96.68% から、削減されたプロファイルでは 62.32%、デモグラフィック情報のみでは 51.00% へと単調に低下した。これにより、従来の属性情報のみの推論では十分な予測信号が得られないことが実証された。

提案手法の詳細

プロファイルに基づくプロンプト設計と、12 種類の LLM 構成による二値反応予測パイプラインを構築した。直感的な設計として、ユーザーの過去の行動履歴や詳細なプロファイル情報をコンテキストに含めることで、モデルが個人特有の嗜好を再現できるようにしている。Figure 2: 10個のコアLLM構成および2つのGPT-5.5 Proプロファイル劣化条件における全体の二値ライク/ディスライック予測精度。

評価・考察

評価の結果、フルプロファイル条件での精度は 75.54% から 96.68% の範囲に収まり、モデル選択によって最大 30 ポイントの差が生じることがペア McNemar テスト等で確認された。また、教師あり分類器が leave-post-out 条件で 15.4% に崩壊する一方、LLM は真のゼロショット汎化を維持している。Figure 3: 3つのプロファイル条件およびMLのleave-post-out結果におけるGPT-5.5 Proの予測精度を示す劣化ラダー。

応用例と今後の展望

本手法は、デプロイ前のレコメンデーションシステムのストレステストや、プラットフォームガバナンスの検証に活用できる。一方で、大規模な合成エージェントの群れが世論誘導のリスクとなる可能性も示唆されている。日本のテックリードやエンジニアは、SNSプラットフォーム向けアルゴリズムの開発・検証、およびレコメンデーションシステムの安全性評価において、個人プライバシーに配慮しつつこうしたシミュレーション手法を導入・検討する規模感が求められる。

結論

LLM エージェントを用いたソーシャルメディアの反応予測は、完全なプロファイル情報が存在する条件下で高い精度を達成する一方、属性情報のみに依存した予測では精度が著しく低下することが示された。本研究は、レコメンデーションシステムのテストにおける有効性を裏付けるとともに、合成エージェントの利用に伴うリスクへの警鐘を鳴らすものである。

注釈

  • LLM: 大規模言語モデル(Large Language Model)。
  • ゼロショット汎化: 事前の特定の学習を行わずに、未知のタスクやデータに対してモデルが対応する能力。