📜 papers

2026-09-30 · 5 topics

物理コーディングによる自己進化型ロボットエージェント HexaAnything──RoboCasa365 で既存 VLA モデルを上回る成功率を実証

🔥🔥

タスク状態と制御を明示的なコードとして表現する物理コーディング手法を提案し、RoboCasa365 ベンチマークで既存の XR-1 VLA を上回るタスク成功率を達成した。

生ピクセル直接入力型マルチモーダルモデルのスケーリング則を解明──計算量 $10^{22}$ FLOPs で従来型エンコーダと同等性能に到達する見通しを提示

🔥🔥

事前学習済みビジュアルエンコーダを廃したエンコーダフリー MLLM のスケーリング則を体系的に分析し、大規模計算量下での性能逆転の可能性を明らかにした。

小規模推論モデルの限界を克服する選択的クエリフレームワーク FlyBy──Qwen3-14B を低コストで超える性能を実証

🔥🔥

自己修正の限界と知識ボトルネックを診断し、必要に応じて上位モデルへクエリを投げる FlyBy により、FlyBy-4B は Qwen3-14B 比 2.7 倍安価でありながら 45.96% の pass@8 を達成した。

実展開トレースからエージェント行動ベンチマークを自動構築する TraceDance──9 大フロンティア LLM の平均正解率 26.7% を実証

🔥🔥

実世界のエージェント運用ログから望ましくない行動のベンチマークを自動構築し、参照回答なしで次ターンを評価するシステム TraceDance を提案した。

汎用エージェント向け環境拡張手法 CompoWorld──複数サービス連携タスクで 8 ベンチマーク平均 9.17pt 向上を達成

🔥🔥

再利用可能なサービスライブラリの組み合わせによりタスク空間を拡張し、Qwen3.6-35B-A3B を用いた検証で AutomationBench にて Claude Opus 4.6 を超越した。