📜 papers
2026-08-19 · 5 topics
LRM の時間的推論を動的生成とアレンの区間代数で検証するフレームワーク TRACE と TRACEBench の公開
🔥🔥動的なテスト生成とトレース検証により、LRM の時間的推論におけるスプリアス推測率が中規模モデルで約 28% に達することを暴いた。
LLM のシステマティックレビュー選別精度を高める補助的不確実性信号の評価手法
🔥🔥BERT+GCN による不確実性信号の付与により、Cohen ドラッグクラスのデータセットで F1 値を 0.011 向上させつつリコールを維持した。
マルチモーダルモデルの抽象推移能力を問うベンチマーク The Unwritten Benchmark の公開と人間・機械間の深刻な性能格差の実証
🔥🔥筆記音と手の動きから非可視の文字を復元するタスクにおいて、人間が 80% 超の精度を記録する一方、GPT-4o や Gemini 2.5-Pro などの主要モデルは 10% 未満にとどまった。
バックプロパゲーション不要のドメイン適応手法 FPO──標準微調整比 2.7-3.2 倍のスループットと 40% のメモリ削減を達成
🔥🔥クロスレイヤーの逆伝播を行わずに大規模言語モデルのドメイン適応を実現し、メモリ使用量を約 40% 削減しつつ汎用ベンチマークをベースラインのシードノイズ内に維持した。
複数主要ラボの API に準拠するオープンソース AI アプリケーションサーバー OGX の全貌──20 以上の推論プロバイダーと 13 のベクトル DB を統合
🔥🔥主要フロンティアラボの API を単一のインターフェースで統合し、アプリケーションコードを変更せずに推論エンジンやベクトル DB を切り替え可能にするオープンソース AI アプリケーションサーバー。