📜 papers

2026-08-01 · 5 topics

エージェントツール選択を改善する MagicSelector ──カウンターファクトラル分解とプログレッシブ再ランク付けで OOD 汎化性能を向上

🔥🔥

カウンターファクトラル分解とプログレッシブ再ランク付けにより、エージェントのツール検索における冗長なノイズとコンテキストの散逸を抑制する統合最適化フレームワーク。

検索空間を事前に制限するセマンティック制御型 RAG 拡張手法 GuidedRAG──検索関連性を 14.0-15.8% 向上しつつオーバーヘッドを大幅削減

🔥🔥

従来型 RAG の検索ステージ前段にセマンティック選別を導入し、検索関連性を 14.0-15.8% 向上、ユーザー意図との整合性を 31.8-36.8% 改善した手法。

フロンティア LLM の自動レッドチーミング手法 GPT-Red──自己対話学習で人間を超えるプロンプトインジェクション発見を実証

🔥🔥

大規模な自己対話学習により、GPT-5.5 以下のモデルを確実に突破し人間のレッドチーマーを凌駕する攻撃を自動発見する GPT-Red を提案。GPT-5.6 の安全性向上を達成した。

強化学習と教師あり微調整の内部表現差を解明──数学推論タスクにおけるレイヤー構造と線形分離性を分析

🔥🔥

RL 訓練モデルは SFT モデル比で内部表現の線形分離性が高く、深層ほど重要度が急増する階層構造を持つことを解明した。

複数ソースと異種ハードウェアを網羅するLLMカーネル生成ベンチマーク KernelGenBench の登場

🔥🔥

210の演算子と6種のハードウェアプラットフォームでLLMおよびエージェントベースのTritonカーネル生成性能を検証し、プラットフォーム間の深刻な性能劣化と大規模なトークン消費を明らかにた。