📜 papers

2026-08-04 · 5 topics

主張と証拠のトレーサビリティを保証するエビデンスレジャー検証手法──既存比 29.3pt 増の精度を実証

🔥🔥

AVeriTeC等の2,335行の盲検ベンチマークにおいて、エージェントベースのエビデンスレジャー検証が関係抽出精度0.676、マクロF1スコア0.601を達成した。

自己検証と信頼度強化学習による適応型推論手法 SVR──Qwen3.5-2B で平均 2.99 ターンでの効率的解決を実証

🔥🔥

推論時の計算量を最適化するため、検証結果と信頼度を組み合わせた強化学習フレームワークにより平均 2.99 ターンでの高精度な推論を実現した。

OpenClaw と Ollama による Agentic AI アーキテクチャ──推論・オーケストレーション・実行レイヤーの統合とスケーラビリティ検証

🔥🔥

Ollama を推論層、OpenClaw をランタイム層に据えた階層型 Agentic AI システムを提案し、持続的メモリとツール利用の統合によりタスク成功率がアーキテクチャ複雑性の増加に伴い単調増加することを実証した。

AI Scientistシステムの自動査読ベンチマーク──FARSが他フレームワーク比 2 倍超の最高評価を獲得

🔥🔥

自動生成された研究論文を評価する初のベンチマークプロトコルを提案し、複数モデルによる査読でFARSの優位性と評価の信頼性を実証した。

数学的予想自動発見フレームワーク──Lean 4 による形式検証で 20 件の新規予想の型安全性を確認

🔥🔥

局所的証拠の探索、新規性と重要度のリフレクティブ検証、Lean 4 による形式検証の 3 段階パイプラインにより、既存手法に吸収されない新規数学的予想を生成。