📜Papers🔥🔥

20年間のクラブ経営でLLMエージェントの長期的意思決定を評価するFM-Benchを公開

26のツールと最大400回の意思決定ポイントを通じて、LLMエージェントの長期的戦略遂行能力を検証した。
リリース: 2026-08-19 · 読了 5

論文概要

LLMエージェントは限定的なタスクを高い信頼性で実行できるようになったが、行動が累積的な結果を生み、環境が変化する長期間にわたる意思決定能力の評価は不十分であった。本論文では、LLMエージェントが20年間のサッカークラブ経営を通じて長期的な意思決定を行うベンチマーク「FM-Bench(Football Management Benchmark)」を提案する。エージェントは26のツールと約340から400回の意思決定ポイントを持ち、予算管理、選手獲得、契約交渉、施設投資、試合のスタメン設定を行う。LLMのジャッジや人間の評価者を介さず、決定的エンジン(Deterministic Engine)によってスコアが算出される点が特徴である。

Figure 1: Figure 1は、LLMエージェントが20年間のサッカークラブ経営を行う仕組みと意思決定ストップの構造を示しています。

関連研究

従来のエージェント評価は短期間のタスクや静的な環境における検証が中心であった。複数エージェントが競合する環境下や、数十年スケールの累積的結果を伴う長期的タスクにおけるモデル間の実証的比較はほとんど行われておらず、本研究は競合環境における大規模な頭突き合わせ評価を初めて実現した。

新規性と貢献

本研究の最大の貢献は、LLMエージェントの「長期的エージェント能力(Long-Horizon Capability)」を測定する、人手によるバイアスを排した決定的な評価基盤を構築した点にある。15のフロンティアモデルを対象としたソロトラックおよび共有世界のアリーナ評価により、モデルの規模やコストが必ずしも長期的な経営成果に直結しないという新たな知見が得られた。

提案手法の詳細

FM-Benchでは、エージェントはクラブの経営者として、取締役会からの解任リスクを避けながら予算内でスクアッド(選手層)を構築する。20年間のシミュレーションには26の専用ツールが用意されており、エージェントは各意思決定ストップで適切な判断を下す必要がある。

Figure 3: Figure 3は、裁量支出の配分とアイドルキャッシュ比率が最終スコアに与える影響を示しています。

評価・考察

15のフロンティアモデルを用いた実験の結果、全モデルが20年間のホライズンを完走した一方、スクリプト化されたベースラインの多くは途中で破綻した。ソロボードの平均スコアおよびアリーナでは claude-fable-5 が最高成績を収めたが、タイトルは10のモデル間で分散した。モデルの順位はモデルの規模、価格、ベンダーのいずれとも相関せず、ホライズンの後半になって初めて順位が収束することが判明した。また、人間の初見プレイヤーはモデルボードの最下位にとどまった。高スコアモデルは、終盤の長期リターン投資を削減し、現金を遊ばせず投資し、契約更新を早期に行う傾向が見られた一方、トークン消費量は性能と相関しなかった。

Figure 6: Figure 6は、全16シートが競い合う共有世界のアリーナにおける、シーズンごとのコンポジットスコアと順位の推移を示しています。

応用例と今後の展望

本ベンチマークの成果は、金融ポートフォリオ管理やサプライチェーン最適化など、累積的な意思決定を伴う産業領域のエージェント開発において重要な示唆を与える。特に日本の金融・流通分野における複雑なリソース配分システムの設計において、現行のLLMエージェントのメモリ管理や長期戦略の欠如を補うための開発指針として活用できる。今後の課題として、市場の隠れた価格変動の学習や、自己管理型メモリ(肥大化し続けるアーカイブや毎シーズン書き換えられるプラン)の欠陥を克服するアーキテクチャの改良が挙げられる。

結論

FM-Benchは、LLMエージェントの長期的・競合的意思決定能力を測定するための厳密な環境を提供する。実験により、計算量やモデルサイズではなく、リソース管理や投資タイミングといった行動特性こそが長期的な成果を左右することが実証された。

注釈

  • LLMエージェント: 大規模言語モデルを頭脳として、自律的にツールを呼び出しタスクを遂行するシステム。
  • ホライズン: エージェントが意思決定を行うシミュレーション上の時間的な期間。