📜 papers

2026-08-28 · 5 topics

実スケール都市環境評価サンドボックス UrbanGround の提案──香港の 3D 地理空間データに基づく MLLM エージェントの空間行動限界の解明

🔥🔥

香港の 3D 地理空間データを元にした実スケール都市サンドボックス UrbanGround を用いて MLLM エージェントの長距離移動や環境適応に伴う累積誤差の課題を実証した。

小規模 LLM の失敗モードを活用する推論時フレームワーク CritICL──外部検証なしで推論コストを削減しつつ性能を向上

🔥🔥

モデル間の失敗パターンの構造的類似性に着目し、弱モデルの失敗を文脈例として活用することで、生成回数を抑えつつテスト時スケーリングと同等以上の性能を実現した。

AI エージェントの経験を永続的知識ベースに蓄積するフレームワーク WikiSkill

🔥🔥

エージェントの実行経験を wiki 型の知識ベースに集約・統合することで、従来手法を上回る汎用的なスキル進化を実現。

ラベル不要のテスト時強化学習 TTPO──Qwen3-1.7B の推論精度を 38.0% から 45.2% に向上

🔥🔥

正解ラベルを必要としない非対称目的関数により、マジョリティ投票の誤りを防ぎつつ競争レベルの数学的推論でラベル付き学習と同等の性能を実証した。

ソフトウェア工学 LLM の SFT 効率化手法 SWE-Prime──10% のデータ選別で SWE-Bench Verified 比 24.2% 向上

🔥🔥

軌跡とセグメントの 2 段階でノイズを除去するデータ選択手法により、データ量を 1/10 に削減しつつ精度を最大 24.2% 向上させた。