2026-08-23 · 5 topics
リアルタイム対話を実現するオープン Vision-Language Model MOSS-VL──ストリーミングタスクで最高水準を記録
🔥🔥🔥視覚情報をデコード配列の外側に配置し、音声生成と並行したリアルタイム知覚を可能にすることで OmniMMI Proactive Alerting で 66.0 を記録しベースラインを圧倒した。
科学技術計算向けコード生成評価 SWE-bench Science 公開──最高性能モデルでも Pass@1 が 50% 未満と判明
🔥🔥20科学分野の119タスクを網羅する新ベンチマークにより、科学ソフトウェア開発におけるコーディングエージェントの4大失敗メカニズムを解明した。
複数モデルの協調学習により教師データなしで推論能力を獲得する Co-RL フレームワーク──テキストとマルチモーダルで既存ラベルフリー手法比 2.3〜8.6% の精度向上を達成
🔥🔥パラメータを共有しない異種エージェント間のピア評価を用いることで、自己報酬型 RL の課題である報酬ハッキングやモデルの崩壊を防ぎ、教師データなしで高い推論能力の獲得に成功した。
長文脈 LLM エージェントの進化戦略によるフルパラメータ最適化手法 Agentic ESOpt──最小限の GPU メモリで WebArena-Lite のベースライン比 6.69% 向上を達成
🔥🔥推論レベルの最小限の GPU メモリで大規模言語モデルのフルパラメータ最適化を実現し、WebArena-Lite においてベースライン比 6.69% の精度向上を達成した。
複数報酬の最適化効率を高める SA-MRPO 手法──AIME24 で最大 5% の精度向上を達成
🔥🔥報酬ごとの飽和度に応じてアドバンテージを動的に再重み付けし、未達成の目的に最適化リソースを集中させることで複数報酬 LLM 事後学習の効率を改善する。