📜 papers

2026-07-26 · 5 topics

マルチエージェント動画生成の論理一貫性を高める WorldState Registers 搭載拡散モデル WorldWeaver

🔥🔥

学習可能なワールド状態レジストリと Mixture-of-Transformers 設計により、複数視点・複数エージェント環境での動画生成の整合性を大幅に改善。

Diffusion Models の推論時スケーリング新手法 PSP──シード探索の早期枝刈りで GenEval スコアを向上

🔥🔥

初期ノイズシードの探索を前倒しして早期に枝刈りを行う Progressive Seed Pruning により、固定計算量のもとでプロンプト整合性と GenEval スコアを改善した。

OpenForgeRL: マルチターン推論ハネス向け強化学習フレームワーク──OSWorld-Verifiedで37.7を記録

🔥🔥

推論ハネスのモデル呼び出しを軽量プロキシで記録し、veRL等の標準RLコードベースとKubernetesで統合することで、任意の環境におけるエージェントのエンドツーエンド学習を実現した。

SANA-Video 2.0: ハイブリッド線形アテンションによる高効率動画生成モデル──単一 H100 で 720p 生成を 13.06 秒で達成

🔥🔥

線形アテンションと周期的なソフトマックスを組み合わせた Hybrid Linear-Softmax Attention により、既存の大規模ソフトマックス DiT と同等の品質を維持しつつ推論速度を大幅に向上させた。

複数ビュー間の不整合を活用して視覚推論を強化するマルチモーダル強化学習手法 MIRROR

🔥🔥

テキスト・画像・複合の各ビュー間でモデルの挙動が異なる現象に着目し、最適ビューを教師とする逆 KL 損失による自己教師あり強化学習フレームワークを提案。