📜 papers

2026-09-04 · 5 topics

LLM の評価認識を測定する新ベンチマーク EvalDetectBench ──評価時とデプロイ時の振る舞いの乖離を定量化

🔥🔥

フロンティア LLM が評価環境を認識する能力を測定する EvalDetectBench を提案し、デプロイ元の選定ミスがモデルランキングを変動させる系統的バイアスを特定した。

複数検索シグナルとチャンク単位評価を統合した企業向け RAG 手法 DocuSearch──Precision@10 で既存手法比 15pt 向上

🔥🔥

ベクトル検索・BM25・知識グラフを RRF で融合し、チャンク単位の厳格なグラウンディング評価によりハルシネーションを防ぐ企業向け RAG システムを提案した。

マルチモーダル文書検索の効率化手法 NeoMME ── 800M パラメータで nDCG@10 0.556 を達成

🔥🔥

260M/800Mパラメータの双方向Transformerにより、ViDoRe v3で高精度と既存比約2倍のスループットを両立。

RAGの多段階推論を改善するPRO-STEP──ステップ単位の報酬最適化で 5 つのベンチマーク平均 EM・F1 を最高値に更新

🔥🔥

生成型PRMと木探索による選好ペア構築、およびステップ単位のDPO最適化により、多段階RAGのエラー伝播を抑制して精度を向上。

LLMエージェントの長ホライズン劣化に関する実証研究──16ステップ以内で成功率がほぼゼロに収束する幾何学的崩壊を実証

🔥🔥

9モデルと3つの独自システムを用いた大規模検証により、タスク成功率はステップ数に応じた幾何学的減衰に従い、コンテキスト制限よりもステップ数が崩壊の主因であることを解明した。