📜 papers

2026-07-29 · 5 topics

LLM による形式的セキュリティプロトコル解析の評価──推論モデルは精度 66.5% に達するも攻撃検知は 5 割未満

🔥🔥

GPT および DeepSeek を用いた 130 件の難読化プロトコル解析評価により、推論モードは精度を大きく高める一方で攻撃検知率は半数に留まることを実証した。

プロンプトインジェクション検出で SOTA を達成する 184M パラメータの安全性分類器 Semalith v1.4

🔥🔥

DeBERTa-v3-base をベースに単一フォワードパスで 3 軸の安全性評価を実現し、Llama-Guard-3-8B 比で 44 分の 1 のパラメータ数ながらプロンプトインジェクション評価で全勝を達成した。

小規模医療特化型 LLM のエージェント型ワークフロー設計──DiagnosisArena で 60.14% を記録し巨大モデルを凌駕

🔥🔥

JSL Medical Small 7B v2 に 5 段階のワークフロー制約を導入することで、標準プロンプト比 +36pt の精度向上を達成しつつ、商用大規模モデルのコストと精度を上回った。

LLM エージェントの構造化メモリーにおける忘却制御手法 SF-AMS──マルチホップ推論で F1 スコア 9.65 向上を達成

🔥🔥

メモリー単位の重要度を動的ユーティリティ信号でモデル化し、冗長情報を排除する SF-AMS により、Qwen2.5-7B で既存手法比 9.65 F1 の向上を実現した。

複数回入院の縦断的臨床推論を評価する医療対話ベンチマーク MedLoCoMo が登場──平均 7.4 万トークンの長文脈でクロスアドミッション推論の困難性を実証

🔥🔥

MIMIC-IV から構築された平均 74,512 トークンの医療対話ベンチマークにより、長文脈 LLM における複数回入院を跨いだ臨床推論の課題が明らかになった。