📜 papers
2026-10-04 · 5 topics
プログラマブル世界モデルの忠実度を検証するベンチマーク PROWBench──170のエピソードと600本のプロキシ動画で検証
🔥🔥プログラムの実行記録と生成動画の整合性を検証する PROWBench を提案し、VLM ベースの指標でエンティティ制御や長文脈記憶を評価した。
実ファイルと証拠グラフでマルチステップ作業エージェントを訓練する GraphForge フレームワーク
🔥🔥実ファイルの証拠グラフからタスクと検証用ルブリックを自動合成し、Qwen3.6-27B の GDPVal を 1445.7 (+65.7) に向上させた。
AI 査読の修辞的堅牢性を評価するベンチマーク RobustReview と二分岐査読手法 SciCore の提案
🔥🔥内容不変の書き換えに対する不安定性を指摘し、フル原稿評価と構造化サイエンスコアを融合した SciCore により安定性と識別力を両立させた。
連続型拡散言語モデルの性能を左右するテキスト埋め込みの最適化手法──T5Gemma-2 蒸留により Gen. PPL 17.8 を達成
🔥🔥テキスト埋め込みのスケールアップとソフトラベル蒸留により、拡散言語モデルの潜在空間を滑らかにし、OpenWebText で GPT-2-M を上回る生成 Perplexity を実証した。
GPT-6 Astra ロボットエージェント PyRUA-Lean──トークン量を 65% 削減しつつ成功率 14% 向上
🔥🔥フィードバック駆動型のプリミティブ構成と選択的観察により、LIBERO-PROなどのベンチマークでトークン消費量を65%削減しつつ成功率を71.7%に高めた。