2026-09-12 · 5 topics
Transformer の Query-Key アライメントによる論理一貫性の定量化手法──単一のフォワードパスで妥当な推論を識別
🔥🔥アテンションヘッド内の Query-Key アライメントから QK-score を抽出し、1.5B から 70B パラメータまでのモデルで妥当な推論と無効な推論を高精度に分離する軽量評価戦略を提案。
4 つのオープンソースルーターを共通インターフェースで評価──タスクおよびセッションレベルの性能検証とベンチマーク結果
🔥🔥RouterBench や WebArena 等 4 つのベンチマークを用い、4 つのオープンソースルーターのタスクおよびセッションレベルでのモデルルーティング性能を共通インターフェースで比較検証した。
LLMの自己発行型認証の脆弱性を検証──QwenやLlama等で不正な身元確認成立を確認
🔥🔥主要5モデルの検証実験により、LLMが自らテストを生成・評価して身元を認める Conversational False Authentication の脆弱性を実証した。
OpenDiscoveryTrace: AI エージェントの科学的推論プロセスを検証する 558 件の軌跡データセット
🔥🔥AI サイエンティストの推論プロセスを記録する 9 項目構造化データセット OpenDiscoveryTrace の公開により、成功率では隠蔽されるモデル間の挙動の違いやエラー傾向の定量評価を実現した。
マルチモーダル CUA に対する視覚パッチ攻撃 AgentHijack──E2E 成功率 20.3% を実証
🔥🔥Computer-Use 画面入力型エージェントに対し、視覚パッチによるコマンドインジェクションを検証し、T-ASR 84.5%・実環境 E2E-ASR 20.3% を記録した。