📜 papers
2026-09-24 · 5 topics
長文脈 LLM のコンテキスト汚染を解明──注意機構の極値干渉と必要マージンを数式で導出
🔥🔥長文脈 LLM における注意機構の極値干渉を定式化し、精度維持には証拠マージンが有効妨害数 N に対して $\Omega(\sqrt{\log N})$ でスケーリングする必要があることを有限標本上界として導出した。
多言語LLMの安全性低下データを除去するマルチレイヤーフレームワーク MMSAFE──有害応答率を 60% 削減
🔥🔥多言語環境における安全性信号の層間分散に着目し、複数レイヤーから安全劣化データを特定することで、有害応答率をランダムフィルタリング比で 60% 削減した。
LLM 選好における非推移性を説明する複数潜在選好モデル──単一順序仮説の限界を検証
🔥🔥LLMの選好に生じる非推移性は単一の潜在的順序ではなく複数の内部一貫性を持つ選好の集約に起因することを示し、混合Bradley-Terryモデルにより予測精度が向上することを実証した。
GUI 操作エージェントの安全性とタスク遂行力を同時最適化するフレームワーク SCOPE の提案
🔥🔥Qwen3.5-9Bをベースに能力と安全性の双方を向上させ、OSWorldでタスク成功率54.17%、OS-BLINDで攻撃回避率64.30%を記録した。
長期文脈広告エージェントの学習における SFT と RL の最適配分手法──非一律適用で 7 スキル平均デルタを +3.57 に向上
🔥🔥SFT と強化学習を無分別に適用するのではなく、教師データの信頼性と報酬観測性に基づいて適応的に配分し、計算コストを 43% 削減しつつ性能を向上させた。