📜 papers

2026-10-08 · 5 topics

AI エージェントの実行時間制御と時間認識を評価する新ベンチマーク AgentTime──実測値との乖離係数 1.2 から 2.9 までを実証

🔥🔥

AI エージェントのランタイム制御や時間予測能力を検証するベンチマーク AgentTime を提案し、最先端モデルにおける時間制御精度の実態と課題を明らかにしました。

VLA の一般化性能を高める強化学習手法 DRIVE──OOD 成功率を最大 9.2pt 向上

🔥🔥

成功軌跡の多様性を明示的な報酬として最適化する DRIVE により、多様な環境変化に対する VLA モデルのロバスト性を大幅に向上させた。

拡散モデルの視覚推論を強化する Painter-Thinker:再帰的潜在推論で難問 Sudoku の正答率 92.5% を達成

🔥🔥

ピクセル空間における再帰的推論ネットワークを導入し、既存の Diffusion Models 比でパラメータ数を 10M に削減しつつ難問 Sudoku の正答率を飛躍的に向上させた。

ライブ市場でLLMエージェントのプロセスを評価するベンチマーク LiveMACEBench を発表

🔥🔥

実環境での意思決定プロセスを30日間のライブ評価で解析し、結果と能力の乖離を実証した。

MUNITE: 任意のマルチモーダル生成を単一の条件付きフローで統合する潜在推論フレームワーク

🔥🔥

観測された情報の量に応じてエンコーディングと潜在生成を同一の問題として扱い、自己蒸留を用いた条件付きフローマッチングにより、多様なマルチモーダル設定で優れた生成品質と整合性を実証した。