📜 papers

2026-08-19 · 5 topics

LRM の時間的推論を動的生成とアレンの区間代数で検証するフレームワーク TRACE と TRACEBench の公開

🔥🔥

動的なテスト生成とトレース検証により、LRM の時間的推論におけるスプリアス推測率が中規模モデルで約 28% に達することを暴いた。

LLM のシステマティックレビュー選別精度を高める補助的不確実性信号の評価手法

🔥🔥

BERT+GCN による不確実性信号の付与により、Cohen ドラッグクラスのデータセットで F1 値を 0.011 向上させつつリコールを維持した。

マルチモーダルモデルの抽象推移能力を問うベンチマーク The Unwritten Benchmark の公開と人間・機械間の深刻な性能格差の実証

🔥🔥

筆記音と手の動きから非可視の文字を復元するタスクにおいて、人間が 80% 超の精度を記録する一方、GPT-4o や Gemini 2.5-Pro などの主要モデルは 10% 未満にとどまった。

バックプロパゲーション不要のドメイン適応手法 FPO──標準微調整比 2.7-3.2 倍のスループットと 40% のメモリ削減を達成

🔥🔥

クロスレイヤーの逆伝播を行わずに大規模言語モデルのドメイン適応を実現し、メモリ使用量を約 40% 削減しつつ汎用ベンチマークをベースラインのシードノイズ内に維持した。

複数主要ラボの API に準拠するオープンソース AI アプリケーションサーバー OGX の全貌──20 以上の推論プロバイダーと 13 のベクトル DB を統合

🔥🔥

主要フロンティアラボの API を単一のインターフェースで統合し、アプリケーションコードを変更せずに推論エンジンやベクトル DB を切り替え可能にするオープンソース AI アプリケーションサーバー。