📜 papers
2026-07-22 · 5 topics
RLHF選好データにおけるレーターステートバイアスの監査フレームワークを提案
🔥🔥アノテーターの心理状態が選好データに混入するバイアスを定義し、報酬モデルへの伝播を検証する監査フレームワークを提示した。
マルチエージェントLLMの計画フェーズを狙う攻撃手法PlanFlip──GPT-5で成功率0.68を記録
🔥🔥Plannerへのプロンプトインジェクションにより下流タスクを連鎖的に汚染する攻撃手法を提案し、同種モデル構成の脆弱性を実証した。
AIエージェントの実行を完全再現するCLIフレームワーク「agrepl」──外部通信を遮断し再現率100%を達成
🔥🔥LLMエージェントの非決定的な挙動をMITMプロキシで記録・再生する手法を提案し、既存の実行環境比で98.3%のレイテンシ削減と完全な再現性を実証した。
3B以下の小型言語モデル9種を評価・微調整するローカル展開向けベンチマーク手法
🔥🔥135Mから3Bパラメータのモデルを対象に、1,085問の構造化ベンチマークと4bit量子化微調整を実施し、Qwen Coder 3Bが微調整後に精度を26.85pt向上させた。
LLMエージェントの責任あるAI実装を自動修復するRAIL Guard──修復成功率96.9%を達成
🔥🔥評価と修復のギャップを埋める閉ループ型パイプラインRAIL Guardを提案し、従来のブロック方式比で収束率を大幅に改善しつつ、フィードバック駆動の自己修復で実用性を維持した。