トランジットキオスク向け LLM 評価ベンチマーク MetroLLM-Bench 公開──4B モデルが GPT-5 級を凌駕
6 つの都市鉄道網と 955 ケースの検証により、2.6GB の 4B PEFT モデルが Tier 1 スコアで GPT-5.6 を上回る性能を実証した。
リリース: 2026-09-09 · 読了 5 分論文概要
本論文では、公共交通機関の券売機や案内端末(トランジットキオスク)のポリシー層としてLLMを評価するための955ケースのベンチマーク「MetroLLM-Bench」を提案している。37〜414駅規模の6つの実際の都市鉄道網をカバーし、経路案内、運賃計算、運行障害、アクセシビリティ、敵対的入力など11のカテゴリーでモデルの制御能力を検証する。構造化ツールの呼び出しと端末状態の提出を義務付け、決定論的なTier 1スコア(14コンポーネント)と、LLMジャッジを含むセマンティック品質のTier 2スコア(8コンポーネント)により評価を行う。
関連研究
従来のエッジデバイスやキオスクシステムにおける自動化は、硬直的な決定論的ルールベースや限定的なステートマシンに依存していた。本研究は、複雑な自然言語の指示や例外的な運行障害の処理において、LLMがどのようにポリシー層として機能するかを体系的に評価する初の試みである。
新規性と貢献
実世界の鉄道網の複雑なデータ構造と障害シナリオを再現した点、および決定論的評価(Tier 1)とセマンティック品質評価(Tier 2)を組み合わせた厳密な評価フレームワークを確立した点が最大の新規性である。これにより、単なるチャット性能ではなく、実務的なシステム制御におけるモデルの信頼性を定量化できる。
提案手法の詳細
717ケースの訓練データと238ケースの評価用ホールドアウトに層化分割し、Parameter-Efficient Fine-Tuning(PEFT)を用いて小規模モデルの適応を行った。構造化された出力と正確なツールコールを強制するため、各ケースで機械可読なターミナル状態(成果物、運賃見積もり、キオスクのアクション)の提出を求めている。
評価・考察
6ベンダーから26モデル(うち23モデルがランキング対象)を評価した結果、Qwen 3.5ベースの4Bパラメータモデル(PEFT適用、2.6GBのQ4_K_Mフットプリント)が、ホールドアウトのTier 1スコアで91.3を記録し、GPT-5.6(90.6および90.0)を上回った。また、最大推論時のGPT-5.4 full(91.4)に匹敵する精度を達成している。一方で、9Bや27Bといった大型モデルでは、この訓練スケールにおいてTier 1のさらなる精度向上は確認されなかった。決定論的ルールベースのベースラインは84.6であり、LLMの優位性はポリシー適応や複合シナリオ、アクセシビリティ、時間的推論に集中していることが示された。
応用例と今後の展望
交通分野やインフラ産業の自動券売機、多言語案内端末、自動応答システムへの実装において、2.6GB規模の軽量モデルが巨大モデルと同等以上の制御性能を発揮することを示している。日本の鉄道・交通事業者におけるエッジデバイスでのローカルLLM運用や、オンプレミス環境でのコスト効率の高いシステム設計において直接的な実装指針となる。
結論
MetroLLM-Benchによる評価から、適切なPEFTを施した軽量な4Bモデルは、交通キオスクのポリシー層として大規模モデルを凌駕するコストパフォーマンスを発揮することが証明された。ベンチマーク、再現ガイド、ファインチューニング済みモデルはオープンに公開されている。
注釈
- PEFT (Parameter-Efficient Fine-Tuning): 事前学習済みのモデルのパラメータを効率的に調整する軽量なファインチューニング手法。
- トランジットキオスク: 駅構内などに設置され、乗車券の購入や経路案内を行うインタラクティブな端末。