📜 papers
2026-08-11 · 5 topics
LLM 監査における出力過多の崩壊を防ぐシャード化手法──全体評価を分割処理して専門家合意率を向上
🔥🔥評価要求を複数回に分割して処理するシャード化により、単一の全体評価で発生する根拠の希薄化や敵対的攻撃に対する脆弱性を解消した。
SmartNIC でリモート埋め込みを予測するフルグラフ GNN 学習手法 SNI-GNN──通信量を最大 45% 削減しつつ速度を 3.6 倍に向上
🔥🔥SmartNIC 上での軽量線形トレンド予測と重要度ベースの境界ノードサンプリングにより、グラフニューラルネットワークの分散学習におけるノード間通信ネックを解消する。
リポジトリレベルの脆弱性を自動合成する CyberForge──SEC-bench でパッチ修復精度が最大 14.7pt 向上
🔥🔥実世界 C/C++ プロジェクトに検証済みの脆弱性を動的に注入する CyberForge フレームワークを提案し、SEC-bench においてモデルのパッチ修復精度を大幅に引き上げた。
Computer-Use Agent の安全性評価ベンチマーク StepJack を公開──マルチステップ間接的プロンプトインジェクションで攻撃成功率が最大 31.2pt 向上
🔥🔥Computer-Use Agent を標的としたマルチステップ間接的プロンプトインジェクション手法と、480 件のテスト例からなる安全性ベンチマーク StepJack を提案し、一部モデルで攻撃成功率が 72.9% に達することを実証した。
LLM の多言語理解ギャップを検証──英語起点評価で性能を 17% 過大評価する傾向を実証
🔥🔥多言語コーパス ParallelQA-18 を用いた検証で、クロス・リンガル理解ギャップが 0.078(17% 減)に達することを解明。