2026-07-28 · 5 topics
再帰的自己改善型ディープリサーチエージェント AREX の提案──122B-MoE と 4B の 2 規模で公開
🔥🔥検証と探索の非対称性に着目した再帰的自己改善フレームワークにより、BrowseComp や Humanity's Last Exam などの困難なベンチマークで同規模のベースラインを大きく上回る性能を実証した。
文書集合の相互作用を評価する SetwiseEvalKit と訓練不要な選択手法 Rubric4Setwise の提案──最高性能でも網羅率 45% 未満の限界を突破
🔥🔥文書間の冗長性や補完関係を評価する 9 次元ベンチマーク SetwiseEvalKit を構築し、訓練不要で高精度な文書集合選択を実現する Rubric4Setwise を提案した。
汚染耐性タスク構築を備えたマルチドメインCoding-AgentベンチマークTencent WorkBuddy Benchの公開
🔥🔥Code、Web、Office、Securityの4ドメインで構成され、実コミットからリバースエンジニアリングでタスクを生成することでWeb検索によるデータ汚染を防ぐマルチドメインCoding-Agent評価スイート。
NVIDIA-labs が提案する Python オブジェクト指向型 AI エージェントフレームワーク NOOA
🔥🔥エージェントを Python オブジェクトとして定義し、メソッドをアクション、型注釈をコントラクトとすることで、決定論的コードと LLM ループを統一した開発フレームワーク。
医療画像分類における量子模倣 CNN と従来型 CNN の比較──HQiCNN の有効性と解釈可能性の検証
🔥🔥量子回路を模倣した HQiCNN と従来型 CNN を医療画像分類で比較し、中間データ量での優位性や解釈可能性の傾向を SHAP ベースの指標で実証した。