📜 papers

2026-07-28 · 5 topics

再帰的自己改善型ディープリサーチエージェント AREX の提案──122B-MoE と 4B の 2 規模で公開

🔥🔥

検証と探索の非対称性に着目した再帰的自己改善フレームワークにより、BrowseComp や Humanity's Last Exam などの困難なベンチマークで同規模のベースラインを大きく上回る性能を実証した。

文書集合の相互作用を評価する SetwiseEvalKit と訓練不要な選択手法 Rubric4Setwise の提案──最高性能でも網羅率 45% 未満の限界を突破

🔥🔥

文書間の冗長性や補完関係を評価する 9 次元ベンチマーク SetwiseEvalKit を構築し、訓練不要で高精度な文書集合選択を実現する Rubric4Setwise を提案した。

汚染耐性タスク構築を備えたマルチドメインCoding-AgentベンチマークTencent WorkBuddy Benchの公開

🔥🔥

Code、Web、Office、Securityの4ドメインで構成され、実コミットからリバースエンジニアリングでタスクを生成することでWeb検索によるデータ汚染を防ぐマルチドメインCoding-Agent評価スイート。

NVIDIA-labs が提案する Python オブジェクト指向型 AI エージェントフレームワーク NOOA

🔥🔥

エージェントを Python オブジェクトとして定義し、メソッドをアクション、型注釈をコントラクトとすることで、決定論的コードと LLM ループを統一した開発フレームワーク。

医療画像分類における量子模倣 CNN と従来型 CNN の比較──HQiCNN の有効性と解釈可能性の検証

🔥🔥

量子回路を模倣した HQiCNN と従来型 CNN を医療画像分類で比較し、中間データ量での優位性や解釈可能性の傾向を SHAP ベースの指標で実証した。