📜 papers

2026-08-30 · 5 topics

動画生成モデルの視覚的推論能力を検証する VGI-Bench──最強モデル Seedance 2.0 でも正答率 51.0%

🔥🔥

27タスク・810インスタンスからなる VGI-Bench を用いた評価により、現行の動画生成モデルにおけるゼロショット視覚推論の限界と失敗モードを解明した。

教師モデルを不要にする Flow Matching 向けオンポリシー蒸留手法 Self-OPD──追加の特化型モデルなしで報酬最適化を実現

🔥🔥

教師モデルに依存せず自己探索からステップごとの教師信号を得る Self-OPD を提案し、既存の強化学習や蒸留手法を上回る報酬最適化性能を実証した。

エージェントハーネスを動的生成する JIT-Agent を提案──DeepSeek-V4-Flash が DeepSearchQA で GPT-5.6 を超過

🔥🔥

タスク適応型のハーネスをオンザフライで合成する JIT-Agent により、既存のオープン・クローズド LLM のエージェント性能を大幅に引き上げる手法を実証した。

科学的ワークフロー評価ベンチマーク FrontierChallenge 公開──最高性能構成でも達成率 20.6% にとどまる

🔥🔥

量子化学や分子力学など 6 ドメインの 97 タスクを用いて AI エージェントの科学的ワークフロー完遂能力を評価し、部分的な高スコアと実際の完遂能力に大きな乖離があることを実証した。

テキスト・画像・動画を統合処理する汎用マルチモーダル埋め込みモデル WeMM-Embedding──MMEB-v2 で 9B 版がスコア 80.6 を記録

🔥🔥

テキストや動画などの異種データを共通空間へ射影する 2B/4B/9B のマルチモーダル埋め込みモデル群を提案し、MMEB-v2 で既存の 8B オープンソースモデルを超える性能を実証した。