📜 papers

2026-08-12 · 5 topics

産業用リサーチエージェントの軌跡を検証可能な証拠へ変換する枠組み──非単調な性能推移とオンライン改善を実証

🔥🔥

マルチラウンド実験の軌跡を事後的に検証・修飾するフレームワークを提案し、証拠に基づいた監査可能な実験記録の保存とオンラインでの効果向上を実現した。

Evaluative AI の形式的基盤としての計算議論学──競合する仮説と根拠を提示するフレームワークを提案

🔥🔥

Evaluative AI に対して、単一の推奨ではなく競合する仮説と根拠を明示するための計算議論学に基づく形式的基盤を提示し、説明可能かつ異議申し立て可能なシステムの長期的な研究アジェンダを論じた。

LLM エージェントによるSNS反応予測手法──完全プロファイル条件で最大 96.68% の精度を実証

🔥🔥

12 種類の LLM 構成をベンチマークし、フルプロファイル条件で 96.68% の精度を達成する一方、属性情報のみでは予測信号がほぼ失われることを確認した。

LLM による A/B テスト勝敗予測の限界を実証──Gemini 3 Flash で Cohen's kappa = 0.14

🔥🔥

330 件の実世界 A/B テストを用いた検証で、LLM 判定の多くが勝率を予測できず、確信度フィルタリングにより有意なサブセットで kappa = 0.31 を達成した。

可変長ロングシーケンス分散学習の効率を 2.88 倍に高める Data-Centric Parallel 手法

🔥🔥

バッチごとの配列長に応じて並列サイズや勾配蓄積を動的に調整し、32基の H200 GPU で 2.88 倍の高速化を実証した。