📁 Category

papers · 340 topics

学術論文 (arXiv / 会議 / 研究機関ブログ)

2026 · Sep

09-07🔥🔥

LLM 自らがアテンション先を動的制御する Declarative Attention ── KV キャッシュ読み取りを最大 52% 削減

09-07🔥🔥

会話履歴を連続メモリトークンに圧縮する LatentPress──LongMemEval で 7.70 倍圧縮時に精度 0.504 を達成

09-07🔥🔥

VLM 基盤モデル Qwen-Drive-1.0 の提案──3D 認識とモーションプランニングを統合

09-07🔥🔥

SMELT: 中間層を 2 度巡回する MoE Looped Transformers でトレーニング FLOPs を最大 18% 削減

09-07🔥🔥

大規模動画生成モデルを対話型ワールドモデルに変換する H3-World──8,000 サンプルで正確なキャラクター・カメラ制御を実現

09-06🔥🔥

自然言語仕様書からローカルニューラル関数を生成するコンパイル手法──FuzzyBench-Hardで83.6%の精度を達成

09-06🔥🔥

6B DiT 基盤の画像生成モデル LLaDA-Image──Qwen-Image-Bench で SOTA を達成し全訓練レシピを公開

09-06🔥🔥

GitHub リポジトリから 5,000 件のスキルを抽出する自律研究エージェント手法 DisCo──MLE-bench で 134.3% の性能向上を達成

09-06🔥🔥

KV キャッシュ圧縮におけるスコアリング不要論──ランダム退避で既存手法と同等の推論精度と 32-43% のスループット向上を両立

09-06🔥🔥

長文脈インタラクションを実現するビデオ世界モデル SolarWM ── 143万クリップの統合データエンジンと5B-33Bモデル群をオープン化

09-05🔥🔥

因果推論のパラダイムを変える Causal Foundation Models の現状と仕組み──個別パイプライン構築を不要にするコンテキスト内学習

09-05🔥🔥

Jina-OCR-v1: 3B MoE と Speculative Decoding で低予算 GPU でも最高スループット 2.57 ページ/秒を達成する文書解析モデル

09-05🔥🔥

インターネット動画から器用なマニピュレーション用デモを回収するデータエンジン RoboTok

09-05🔥🔥

AI 気象モデルの降水予測を改善する観測データ活用手法──CRPS 最大 19% 向上を実証

09-05🔥🔥

エージェントの推論レイテンシを 44.9% 削減する実行機構 Speculative Macro Commit

09-04🔥🔥

LLM の評価認識を測定する新ベンチマーク EvalDetectBench ──評価時とデプロイ時の振る舞いの乖離を定量化

09-04🔥🔥

複数検索シグナルとチャンク単位評価を統合した企業向け RAG 手法 DocuSearch──Precision@10 で既存手法比 15pt 向上

09-04🔥🔥

マルチモーダル文書検索の効率化手法 NeoMME ── 800M パラメータで nDCG@10 0.556 を達成

09-04🔥🔥

RAGの多段階推論を改善するPRO-STEP──ステップ単位の報酬最適化で 5 つのベンチマーク平均 EM・F1 を最高値に更新

09-04🔥🔥

LLMエージェントの長ホライズン劣化に関する実証研究──16ステップ以内で成功率がほぼゼロに収束する幾何学的崩壊を実証

09-03🔥🔥

LLM 事前学習の損失ダイナミクスを支配する有効学習率 ELR の発見──異なる設定間で損失軌跡が完全に一致することを実証

09-03🔥🔥

LLM の動的情報獲得能力を検証する非公開情報下競技プログラミングベンチマーク InteractBench を公開

09-03🔥🔥

Text-to-Image モデルの Machine Unlearning における干渉現象の分析手法 I-CARE の提案

09-03🔥🔥

コンピュータ科学論文の図版理解を強化する大規模データセット SCAFFOLD の構築──15.7万件の QA と推論トレースを公開

09-03🔥🔥

複数領域間数学的探索を行うマルチエージェントシステム EULER──120件の未解決予想に対して10件の証明と3件の反証を達成

09-02🔥🔥

Qwen3-27B の 3 段階カリキュラムファインチューニングによる C から Rust への高精度コード変換

09-02🔥🔥

電力制約下での LLM 推論を最適化する PowerSlider──オンライン goodput を既存比 1.64 倍に改善

09-02🔥🔥

専門家検証済み STEM QA データセット──物理・化学等の 4 分野でフロンティアモデルの正解率 25% 未満を記録

09-02🔥🔥

フロンティア LLM の腫瘍学意思決定における限界を検証──全モデルが解けない共通の盲点を実証

09-02🔥🔥

マルチモーダル推論モデルの同調バイアス測定ベンチマーク──臨床視覚判断で同調率 95.7% に到達

09-01🔥🔥

出力層射影を HNSW で近似する LLM 推論高速化手法──Gemma 3 270M でデコードスループットを 82% 向上

09-01🔥🔥

量子化がトリガーとなる LLM バックドア攻撃手法──FP16 検証済みモデルが INT8/4-bit 圧縮で最大 85% の挙動逆転を示すことを実証

09-01🔥🔥

金融資格試験ベンチマーク FinExam-10K 公開──CFA/FRM対応の10,198問で最高精度 85.29%

09-01🔥🔥

LLM エージェント社会の人間行動適合性を検証する新ツール SILICA ── 12 モデル評価で最終協力状態の再現に全モデルが失敗

09-01🔥🔥

T2I モデルの数量把握の限界を暴く 64 万プロンプトのベンチマーク NumBench と評価指標 cw-NPS の提案

2026 · Aug

08-31🔥🔥

720p 動画と音声を同時生成するオープンな全モーダルワールドモデル EchoWM

08-31🔥🔥

LLM 推論における Evolution Strategies と GRPO の動的比較──より広い推論カバレッジで Pass@K を向上

08-31🔥🔥

ハイブリッド・状態空間モデルの因果律漏れを検出する軽量監査手法──192件の障害を100%特定

08-31🔥🔥

LLM の学習を安定化する Best Practice Critic Optimization (BPCO)──グループサンプリング不要で同等以上の性能を実証

08-31🔥🔥

単一画像から再ライティング可能な 3D アセットを生成する Luce──Toys4K で FID を 28% 改善

08-30🔥🔥

動画生成モデルの視覚的推論能力を検証する VGI-Bench──最強モデル Seedance 2.0 でも正答率 51.0%

08-30🔥🔥

教師モデルを不要にする Flow Matching 向けオンポリシー蒸留手法 Self-OPD──追加の特化型モデルなしで報酬最適化を実現

08-30🔥🔥

エージェントハーネスを動的生成する JIT-Agent を提案──DeepSeek-V4-Flash が DeepSearchQA で GPT-5.6 を超過

08-30🔥🔥

科学的ワークフロー評価ベンチマーク FrontierChallenge 公開──最高性能構成でも達成率 20.6% にとどまる

08-30🔥🔥

テキスト・画像・動画を統合処理する汎用マルチモーダル埋め込みモデル WeMM-Embedding──MMEB-v2 で 9B 版がスコア 80.6 を記録

08-29🔥

Advection-Diffusion 向け Dynamic Likelihood Filtering の拡張と希薄観測での推定精度評価

08-29🔥

生成AIを活用する粒子輸送シミュレーション手法 Generative Monte Carlo──光学的に厚い領域で O(1) の計算コストを実現

08-29🔥

EduRiskX: F-Logic と時系列 Transformer の統合により早期検出率 94.3% を達成した教育リスク予測フレームワーク

08-29🔥

ICU死亡予測の解説における単一LLMとエージェント型パイプラインの比較──2,353件のeICUデータで安全性と根拠性を検証

08-29🔥

大規模モデルによるバッテリー状態管理の最新動向と将来展望──BPHM 分野における LM 応用の包括的サーベイ

08-28🔥🔥🔥

AI が 2 週間でゼロから設計・検証・デプロイしたフロンティア AI アクセラレータ Redwood──Jetson Orin Nano 比で 3.4 倍のワットパフォーマンスを実証

08-28🔥🔥

実スケール都市環境評価サンドボックス UrbanGround の提案──香港の 3D 地理空間データに基づく MLLM エージェントの空間行動限界の解明

08-28🔥🔥

小規模 LLM の失敗モードを活用する推論時フレームワーク CritICL──外部検証なしで推論コストを削減しつつ性能を向上

08-28🔥🔥

AI エージェントの経験を永続的知識ベースに蓄積するフレームワーク WikiSkill

08-28🔥🔥

ラベル不要のテスト時強化学習 TTPO──Qwen3-1.7B の推論精度を 38.0% から 45.2% に向上

08-28🔥🔥

ソフトウェア工学 LLM の SFT 効率化手法 SWE-Prime──10% のデータ選別で SWE-Bench Verified 比 24.2% 向上

08-28🔥🔥

HPC プログラミングにおける LLM 活用状況を体系的レビュー──MPI 等の分散処理で課題残る

08-28🔥🔥

複数ドラフターを協調させる TreeGraft──LLM 推論を最大 26.6% 高速化するツリー型 Speculative Decoding 手法

08-28🔥🔥

LLM は自己の不確実性シグナルだけでハルシネーション時の棄権を学習できるか──ラベル不要の手法で教師ありと同等の精度を実証

08-28🔥🔥

LLM ツール応答の先頭チャンク最適化に関する実証分析──キーワード選抜による p1 改善は下流精度に寄与せず

08-27🔥🔥

視覚生成を推論の媒体とするクローズドールテストベッド VBVR-Pro の提案──300のプロシージャルタスクで汎化性能を確認

08-27🔥🔥

セルエッジ電力制御における Agentic Autoresearch ──手動設計を全廃して従来の 600 倍高速な推論を実現

08-27🔥🔥

テスト時計算量を削減する Prefix Sliding 手法──既存モデルの推論を 3 倍高速化し精度維持を実証

08-27🔥🔥

Transformer アテンションにおける LoRA の必要ランクを理論的に解明──KL 誤差の下限・上限を証明

08-27🔥🔥

リアルタイム音声対話向けデュアル脳型メモリ VoiceMem──Mem0 比で検索精度を 30pt 向上

08-26🔥🔥

SLM を搭載した認知レーダー自動エージェント──自然言語指示によるアレイ信号処理の動的制御を実証

08-26🔥🔥

小規模言語モデル向け直接三線形積 FFN 手法 TriPLU──検証損失 1.0637 を達成

08-26🔥🔥

RLVR における多言語ベリファイアバイアス──Qwen3-8B の日本語で偽陰性率 0.642 に達することを実証

08-26🔥🔥

連続値感情空間を制御する LLM 向け学習手法 VA-DPO──平均 VA 距離を 33% 削減

08-26🔥🔥

エージェント記憶の事前検索失敗を特定──DSGC 機構でフルチェーン保持率を最大 1.00 へ改善

08-25🔥🔥

Claude Code の文脈断絶を解消する PrimeAgentOrchestrator──複数バックエンド統合によるメモリ事前ロード機構を提案

08-25🔥🔥

LLMの職業バイアスを内部表現から解剖する因果フレームワーク──表面化しないジェンダー・人種格差を検出

08-25🔥🔥

EHR処理における中央抜け現象を定量化するQuery-Conditioned Clinical Suppression──中央部精度を 16.7% に改善

08-25🔥🔥

LLMのプロンプト語彙感度を大規模解析──13万件のバリエーションから導いた性能安定性のスケーリング則

08-25🔥🔥

曖昧な検索クエリに対する対話型質問生成ベンチマーク Clarify-Then-Search の提案──情報検索精度への寄与を検証

08-24🔥🔥

PLC コード生成向けエージェントハーネス SemaPLC──動的検証により実行トレース一致率 52.2% を達成

08-24🔥🔥

動画生成のタスク完了能力を評価する SemComp-Bench を公開──6ドメインでの実証結果を報告

08-24🔥🔥

LLMの自己進化を実現する強化学習枠組み SPADE──環境自動生成でベンチマーク精度を最大 13.9pt 向上

08-24🔥🔥

化学的妥当性を考慮した大規模言語モデル C3LM による単段階逆合成予測──OOD URSA-expert-2026 で SOTA を達成

08-24🔥🔥

Zetta ζ: 3重のタイムスケールで動作する物理知能向けクローズド・ループハーネス──LIBERO-Proで 90.8% を達成しつつ 11.1 倍の推速化を実現

08-23🔥🔥🔥

リアルタイム対話を実現するオープン Vision-Language Model MOSS-VL──ストリーミングタスクで最高水準を記録

08-23🔥🔥

科学技術計算向けコード生成評価 SWE-bench Science 公開──最高性能モデルでも Pass@1 が 50% 未満と判明

08-23🔥🔥

複数モデルの協調学習により教師データなしで推論能力を獲得する Co-RL フレームワーク──テキストとマルチモーダルで既存ラベルフリー手法比 2.3〜8.6% の精度向上を達成

08-23🔥🔥

長文脈 LLM エージェントの進化戦略によるフルパラメータ最適化手法 Agentic ESOpt──最小限の GPU メモリで WebArena-Lite のベースライン比 6.69% 向上を達成

08-23🔥🔥

複数報酬の最適化効率を高める SA-MRPO 手法──AIME24 で最大 5% の精度向上を達成

08-22🔥🔥

20年間のクラブ経営でLLMエージェントの長期的意思決定を評価するFM-Benchを公開

08-22🔥

量子分類器で Tactile Internet を保護する VQC-ZTI──誤検知率を ExtraTrees 比で最大 67.9% 削減

08-22🔥

石油工学コミュニティ向け仮想アシスタント ATHENA の開発とデプロイ──RAG ベースライン比で生産性を改善

08-22🔥

BART・BERT・RoBERTa のテキスト要約性能を比較──アーキテクチャ別の評価結果を公開

08-22🔥

生物学的ソフトウェア名を高精度で抽出するハイブリッド型 NER 手法 SNAIL を提案

08-21🔥🔥

4.1億パラメータの言語モデルが自然な物語で人間を超える実体追跡能力を獲得

08-21🔥🔥

形態素境界を意識する構造統一型トークナイザ SuTRA──BPE 比で意味復元力を 34% 向上

08-21🔥🔥

低リソースアフリカ言語向け安全メカニズム回復手法 LSR-Anchoring──再学習なしで有害プロンプト拒否率を改善

08-21🔥🔥

9 個の感情中心から抽出するラベルフリーな Valence 軸──4 モダリティ間でクロス転移を実証

08-21🔥🔥

対話システムの KV キャッシュ効率化手法 Fractional Decay KV-Cache──H2O 比でトピックシフト適応速度 3.6 倍を達成

08-20🔥🔥

予測された情報ニーズに基づき文書を動的に分割する Intent-Driven Dynamic Chunking を提案──検索精度を最大 67% 向上

08-20🔥🔥

治験プログラミングの構造的一致率を 100% に高めるマルチエージェント手法 GxP-Agent

08-20🔥🔥

LLM の金融アドバイスにおける宗教的バイアスを実証──非バイアス回答はわずか 12-18%

08-20🔥🔥

LLM 事後学習向け階層型データ選択手法 MASS──埋め込み空間の幾何学的歪みを解消し全データ学習を凌駕

08-20🔥🔥

Dynamic MoE サービングの定数競合アルゴリズムを証明──ランダム化主問題で競合比 \Theta(1) を達成

08-19🔥🔥

LRM の時間的推論を動的生成とアレンの区間代数で検証するフレームワーク TRACE と TRACEBench の公開

08-19🔥🔥

LLM のシステマティックレビュー選別精度を高める補助的不確実性信号の評価手法

08-19🔥🔥

マルチモーダルモデルの抽象推移能力を問うベンチマーク The Unwritten Benchmark の公開と人間・機械間の深刻な性能格差の実証

08-19🔥🔥

バックプロパゲーション不要のドメイン適応手法 FPO──標準微調整比 2.7-3.2 倍のスループットと 40% のメモリ削減を達成

08-19🔥🔥

複数主要ラボの API に準拠するオープンソース AI アプリケーションサーバー OGX の全貌──20 以上の推論プロバイダーと 13 のベクトル DB を統合

08-18🔥🔥🔥

BERT からフロンティアエージェントまでの 8 年間──コスト削減とタスク特化型モデルの台頭を実証

08-18🔥🔥

LLM による UX マイクロシミュレーション手法──複数プロキシデータセットで検証したアライメント評価とコスト対効果

08-18🔥🔥

LLM エージェント評価における過剰評価を抑制する報酬フリーの評価基準誘導手法 RubricForge

08-18🔥🔥

MoE モデルの深層感度分析──層別マスクにより精度を維持したまま 640 エキスパートを削減

08-18🔥🔥

LLM は人間脳と共通のモジュール構造を獲得する──46タスクの回路解析で実証

08-17🔥🔥

空間知能のためのパラメータ更新不要な自己進化フレームワーク Spatial Memory Agent

08-17🔥🔥

14B パラメータ Diffusion Transformer によるリアルタイム長文脈人間アニメーション手法 LiveAnimate──2基の NVIDIA H100 で 19.63 FPS を実証

08-17🔥🔥

音声と映像を同時に置換するストリーミング手法 UniSwap──サンプリングを 30 ステップから 3 ステップへ短縮

08-17🔥🔥

AI 査読者におけるレトリックの報酬ハッキング──証拠フレームと新規性スタンスが評価スコアを変動させる構造を解明

08-17🔥🔥

完全教師なしオンポリシー自己蒸留手法 U-OPSD の提案──数学推論ベンチマークで既存の教師あり手法を上回る性能を実証

08-16🔥🔥

完全自動の論文生成システム Spark-to-Paper──13のコンポーザブルスキルにより引用妥当性99.5%を実証

08-16🔥🔥

強モデルが弱モデルへ推論時に能力を転写するフレームワーク──Theory-of-Mind ベンチマークで平均精度を 0.49 から 0.91 へ倍増

08-16🔥🔥

自律的メカニズム探索システム Mechanist の提案──1万3000件の解釈可能性知識グラフと32の手法ライブラリでAIの内部機構を解明

08-16🔥🔥

ビデオ生成モデルの潜在表現を再利用する 4D 生成手法 Latent-to-4D──DINO-F1 スコアを最大 5.81 ポイント向上

08-16🔥🔥

BDH-CQ によるインコンテキスト学習と再帰的潜在推論──ARC-AGI-1 でコスト効率のパレートフロンティアを更新

08-15🔥🔥

拡散言語モデル向けPEFT手法 LoRA-Diffusion──重みではなく軌道分解でSST-2最高精度を実証

08-15🔥🔥

推論用 LLM の KV キャッシュを 65% 削減する Thought-Aware Attention Matching (TAM) 手法

08-15🔥🔥

金融文書の誤り検出ベンチマーク FinED-Bench を公開──既存 LLM の高難度タスクにおける精度課題を実証

08-15🔥🔥

AI エージェント向け長期記憶エンジン FluctlightDB──LoCoMo で 99.0% の証拠回収精度を実証

08-15🔥🔥

プライマリパスとデコード処理を分離する Dual-Flow Transformers──推論効率を維持しつつ継続予測の計算量を拡大

08-14🔥🔥

サイバーセキュリティにおける LLM 生成検知ルールの評価フレームワークとベンチマーク

08-14🔥🔥

WavePhaseNet による意味的階層構造の構築──DFT 活用で 24,576 次元を 3,000 次元へ圧縮しつつハルシネーションを抑制

08-14🔥🔥

LLM 推論信頼性向上手法の独立検証──RPC と LCF の一般化限界と効果の小ささを実証

08-14🔥🔥

マルチ LLM エージェント間の制御統制レイヤー Experience Orchestrator──金融シミュレーションでアドバイザー接触率を 32pt 向上

08-14🔥🔥

文献情報からベイズモデルの事前分布を自動構築するエージェント型ツール Distribird──幻覚抑制とローカル実行を両立

08-13🔥🔥

フロンティア LLM のステアリング圧力下における応答モードの分岐評価と内部表現解析

08-13🔥🔥

2万件超のプロファイルから最適エージェントを動的取得する LLM Agents Factory

08-13🔥🔥

LLM チャットエージェント向け三層ドーフドッグ評価フレームワーク──目標指向 NPC シミュレーションでコストを 6,272 分の 1 に削減

08-13🔥🔥

エッジ向け SLM の 4-bit 量子化が多言語処理に与える構造的崩壊とタイポロジカル脆弱性を実証

08-13🔥🔥

LLM の Chain-of-Thought の限界を解明──シリアル深度に依存する計算ボトルネックと +64pt 改善の境界

08-12🔥🔥

産業用リサーチエージェントの軌跡を検証可能な証拠へ変換する枠組み──非単調な性能推移とオンライン改善を実証

08-12🔥🔥

Evaluative AI の形式的基盤としての計算議論学──競合する仮説と根拠を提示するフレームワークを提案

08-12🔥🔥

LLM エージェントによるSNS反応予測手法──完全プロファイル条件で最大 96.68% の精度を実証

08-12🔥🔥

LLM による A/B テスト勝敗予測の限界を実証──Gemini 3 Flash で Cohen's kappa = 0.14

08-12🔥🔥

可変長ロングシーケンス分散学習の効率を 2.88 倍に高める Data-Centric Parallel 手法

08-11🔥🔥

LLM 監査における出力過多の崩壊を防ぐシャード化手法──全体評価を分割処理して専門家合意率を向上

08-11🔥🔥

SmartNIC でリモート埋め込みを予測するフルグラフ GNN 学習手法 SNI-GNN──通信量を最大 45% 削減しつつ速度を 3.6 倍に向上

08-11🔥🔥

リポジトリレベルの脆弱性を自動合成する CyberForge──SEC-bench でパッチ修復精度が最大 14.7pt 向上

08-11🔥🔥

Computer-Use Agent の安全性評価ベンチマーク StepJack を公開──マルチステップ間接的プロンプトインジェクションで攻撃成功率が最大 31.2pt 向上

08-11🔥🔥

LLM の多言語理解ギャップを検証──英語起点評価で性能を 17% 過大評価する傾向を実証

08-10🔥🔥

16B パラメータの自己回帰拡散モデル JoyAI-Video-Edit──Nvidia B200 単機で 720p・30 FPS のリアルタイム映像編集を実現

08-10🔥🔥

経済的エージェントからエージェント経済へ──Economic World Modelsの設計図と6段階の機能ラダー

08-10🔥🔥

LLMのパーソナライズにおける過剰推論を暴くMirageBench:全12モデルで35〜49%の属性捏造を確認

08-10🔥🔥

連続動画ストリームを探索するマルチモーダルエージェント Video-DeepResearch──Claude-4.5-Sonnet を 5.0pt 上回る 64.0% の精度を達成

08-10🔥🔥

3D 生成・理解・編集を統合する Hunyuan3D-Buffalo 1.0──8,700万件のマルチモーダルデータで SOTA を達成

08-09🔥🔥

長文脈ターミナルエージェント向け合成タスク生成フレームワーク RST──1 タスク 0.05 ドルでのスケーラブルな学習データ構築を実現

08-09🔥🔥

長文脈サーチエージェント向け学習手法 ABSeeker──Qwen3.5-4B ベースで 8.5k 例を用い大規模モデルに匹敵する精度を実現

08-09🔥🔥

統合マルチモーダルモデルによる自律型画像生成手法 ToolArtist──外部ツールとネイティブ画像生成を単一ポリシーで動的連携

08-09🔥🔥

統合マルチモーダル事前学習のメカニズムを解明──13.5B MoE モデルと 5% の計算量で強力な生成性能を実証

08-09🔥🔥

大規模 3D オープンワールド自動生成手法 WorldClaw──テキスト指示から空間整合性を維持したシーン構築を実現

08-08🔥🔥

NVIDIA B300における大規模言語モデルのマルチノード全段微調整──実運用に基づく電力トリアージとネガティブ結果の検証

08-08🔥

8 種の LLMにおけるライブラリ・言語選好の調査──NumPy の過剰利用と Python 偏重を実証

08-08🔥

結合最適化における暗黙正則化を実現する適応型オプティマイザ FlowAdam

08-08🔥

MLLM の数量的限界を暴く包括的ベンチマーク HoloCount──20 モデル超の評価で判明した推論・頑健性の課題

08-08🔥

LLMの動的プロジェクトスケジュール制御──GP進化型知識の逆転導入による精度と安定性の向上

08-07🔥🔥

複数視点の動的状態を分離するマルチプレイヤーワールドモデル MASS──1,024 人の同時接続で 10,000 ステップの安定予測を実証

08-07🔥🔥

可変タイムステップ推論を実現する気象予測モデル GEM-3──単一の重みで予測時間と精度のトレードオフを解消

08-07🔥🔥

LLM 安全性評価の盲点を突く──API とチャット UI・Web 検索の有無で精度が最大 8pt 低下することを実証

08-07🔥🔥

大規模言語モデルによるリアルタイムな陰謀論の信奉低減──暗殺事件直後の実験で有意な効果を実証

08-07🔥🔥

AI エージェントの署名ワークフロー保護に向けたハードウェアキーストア──ゼロトラスト MCP アーキテクチャで攻撃成功率 0.0% を達成

08-06🔥🔥

ICASSP 2026 URGENT Challenge 優勝の GAP-URGENet──生成・予測融合で音声強調の客観評価 1 位を獲得

08-06🔥🔥

自己進化型 LLM エージェントの動的ストリーミング評価手法 AgentStream──単一タスク評価の限界と汎化性を解明

08-06🔥🔥

GPU カーネル自動最適化エージェント KernelBrain──既存比最大 1.4 倍の高速化と 48% の最適化時間削減を達成

08-06🔥🔥

エッジ AI 向け個人メモリ評価ベンチマーク MemArena の提案──50 エージェント 15 日間の対話でメモリバックエンドの性能差を検証

08-06🔥🔥

OpenAI の Privacy Filter を 42 ベンチマークで独立評価──AI4Privacy で F1=0.855 を記録

08-04🔥🔥

主張と証拠のトレーサビリティを保証するエビデンスレジャー検証手法──既存比 29.3pt 増の精度を実証

08-04🔥🔥

自己検証と信頼度強化学習による適応型推論手法 SVR──Qwen3.5-2B で平均 2.99 ターンでの効率的解決を実証

08-04🔥🔥

OpenClaw と Ollama による Agentic AI アーキテクチャ──推論・オーケストレーション・実行レイヤーの統合とスケーラビリティ検証

08-04🔥🔥

AI Scientistシステムの自動査読ベンチマーク──FARSが他フレームワーク比 2 倍超の最高評価を獲得

08-04🔥🔥

数学的予想自動発見フレームワーク──Lean 4 による形式検証で 20 件の新規予想の型安全性を確認

08-03🔥🔥

コーパス拡大で BM25 が勝つ:450倍の規模で検証した RAG パラダイムのスケーリング特性

08-03🔥🔥

オープンエンド領域でのタスク嗜好を捉える On-Policy 蒸留手法 Flux-OPD の提案

08-03🔥🔥

実行可能な Blender コードを思考連鎖に用いる物理整合的ビデオ生成手法 VideoCoCo──PhyGenBench で 0.558 を記録

08-03🔥🔥

リポジトリ文脈管理フレームワーク CodeNib──グラフ更新を 8.7 倍、ベクトル更新を 25.4 倍高速化

08-03🔥🔥

評価基準に基づく強化学習のトークン単位クレジット配分手法 CoRT──既存手法比 4.4pt 向上を達成

08-02🔥🔥

モバイル・PC・Webを統合制御する GUI エージェント Qwen-UI-Agent──MobileWorld-Realで92.2%を達成

08-02🔥🔥

機械学習エンジニアリングの再帰的自己改善を実現する 35B モデル Frontis-MA1──MLE-Bench Lite で 71.21% を記録

08-02🔥🔥

ネイティブメモリを内蔵する初の基盤モデル Metis──外部モジュール依存を脱却し勾配なしで動的更新を実現

08-02🔥🔥

RTX 4090 で 32 Hz・VRAM 1 GB 未満駆動を実現する軽量 VLA モデル「TurboVLA」

08-02🔥🔥

大規模メモリデコーダモデル──6.9Bパラメータの事前学習と分散型 Faiss パイプラインで実現する効率的長期記憶

08-01🔥🔥

エージェントツール選択を改善する MagicSelector ──カウンターファクトラル分解とプログレッシブ再ランク付けで OOD 汎化性能を向上

08-01🔥🔥

検索空間を事前に制限するセマンティック制御型 RAG 拡張手法 GuidedRAG──検索関連性を 14.0-15.8% 向上しつつオーバーヘッドを大幅削減

08-01🔥🔥

フロンティア LLM の自動レッドチーミング手法 GPT-Red──自己対話学習で人間を超えるプロンプトインジェクション発見を実証

08-01🔥🔥

強化学習と教師あり微調整の内部表現差を解明──数学推論タスクにおけるレイヤー構造と線形分離性を分析

08-01🔥🔥

複数ソースと異種ハードウェアを網羅するLLMカーネル生成ベンチマーク KernelGenBench の登場

2026 · Jul

07-31🔥🔥

LVLM と空間的マッチングで KIE データセット生成を自動化する DocAnnot──CORD で F1 0.679 を達成

07-31🔥🔥

複数ページの視覚的長文脈文書に対応するエージェント型 VLM 検索拡張生成手法 VLD-RAG

07-31🔥🔥

大規模言語モデルのアライメント偽装──デプロイ影響の明示なしでも 5 モデルで発生

07-31🔥🔥

LLMによるCUDAカーネル自動最適化システム Kernel Forge──PyTorchモデルで既存手法比最大2.83倍の高速化を実証

07-31🔥🔥

LLM の裏切り行動は事前学習言語のカバー率に反比例──低リソース言語でスキミングスコアが 34.2% 上昇

07-30🔥🔥

LLM-as-a-Judgeの判定ロジックをプログラムに蒸留するPAJAMA──コストを削除し13Bモデルと同等の精度を達成

07-30🔥🔥

エンタープライズ向けコードエージェント手法 CRAFT──プロンプトのスキーマ依存を排除し、推論コストを 1/9 に削減

07-30🔥🔥

視覚トークン圧縮が MLLM の頑健性を高める──ジェイルブレイク防御で平均 13.29pt 向上を実証

07-30🔥🔥

LLM アライメントデータ監査手法── Shapley 値の推論ベース近似で HelpSteer2 の監査範囲を 99.1% 削減

07-30🔥🔥

Unified-Memory Apple Silicon における CPU+GPU 協調実行機構 FusionML──Llama 型プリフィルを 1.15〜1.38 倍に高速化

07-29🔥🔥

LLM による形式的セキュリティプロトコル解析の評価──推論モデルは精度 66.5% に達するも攻撃検知は 5 割未満

07-29🔥🔥

プロンプトインジェクション検出で SOTA を達成する 184M パラメータの安全性分類器 Semalith v1.4

07-29🔥🔥

小規模医療特化型 LLM のエージェント型ワークフロー設計──DiagnosisArena で 60.14% を記録し巨大モデルを凌駕

07-29🔥🔥

LLM エージェントの構造化メモリーにおける忘却制御手法 SF-AMS──マルチホップ推論で F1 スコア 9.65 向上を達成

07-29🔥🔥

複数回入院の縦断的臨床推論を評価する医療対話ベンチマーク MedLoCoMo が登場──平均 7.4 万トークンの長文脈でクロスアドミッション推論の困難性を実証

07-28🔥🔥

再帰的自己改善型ディープリサーチエージェント AREX の提案──122B-MoE と 4B の 2 規模で公開

07-28🔥🔥

文書集合の相互作用を評価する SetwiseEvalKit と訓練不要な選択手法 Rubric4Setwise の提案──最高性能でも網羅率 45% 未満の限界を突破

07-28🔥🔥

汚染耐性タスク構築を備えたマルチドメインCoding-AgentベンチマークTencent WorkBuddy Benchの公開

07-28🔥🔥

NVIDIA-labs が提案する Python オブジェクト指向型 AI エージェントフレームワーク NOOA

07-28🔥🔥

医療画像分類における量子模倣 CNN と従来型 CNN の比較──HQiCNN の有効性と解釈可能性の検証

07-27🔥🔥🔥

Ascend SuperPOD での DeepSeek-V4 全パラメタ事後学習──MFU 34.22% と OR タスクでの GPT-5.4-Mini 超えを達成

07-27🔥🔥🔥

汎用ロボット基盤モデル RynnBrain 1.1──最大 122B スケールで VSI-Bench 等の主要ベンチマークを圧倒

07-27🔥🔥

4B規模の画像生成・編集モデル Mage-Flow──Mage-VAEと融合により学習スループットを2.5倍に向上

07-27🔥🔥

単眼カメラでの指示追従型視覚追跡を実現する ReferTrack──EVT-Bench のシングルターゲットで成功率 89.4% を記録

07-27🔥🔥

コード生成 LLM の内部状態を利用するコンテキスト圧縮手法 SWE-Pruner Pro──トークン量を最大 39% 削減しつつ SWE-bench Verified を 3.8% 向上

07-26🔥🔥

マルチエージェント動画生成の論理一貫性を高める WorldState Registers 搭載拡散モデル WorldWeaver

07-26🔥🔥

Diffusion Models の推論時スケーリング新手法 PSP──シード探索の早期枝刈りで GenEval スコアを向上

07-26🔥🔥

OpenForgeRL: マルチターン推論ハネス向け強化学習フレームワーク──OSWorld-Verifiedで37.7を記録

07-26🔥🔥

SANA-Video 2.0: ハイブリッド線形アテンションによる高効率動画生成モデル──単一 H100 で 720p 生成を 13.06 秒で達成

07-26🔥🔥

複数ビュー間の不整合を活用して視覚推論を強化するマルチモーダル強化学習手法 MIRROR

07-25🔥🔥

MoEのルーティングはハフマン符号か──Chain-of-ThoughtにおけるFrequency-Diversity Lawの発見

07-25🔥🔥

臨床記録からの皮膚免疫関連有害事象検出──LLM支援でF1スコア0.88を達成しレビュー時間を半減

07-25🔥🔥

材料科学文献分析向けエージェント AlphaAgent──スキル契約による推論精度向上

07-25🔥🔥

RAGのSplit-Knowledge攻撃を検知するグラフ理論手法TopoGuard──既存比21倍の検知率を実証

07-25🔥🔥

韓国語指示チューニング用データセット GLAN-QnA-KR を公開──30 万件超の重複なしデータを生成

07-24🔥🔥

Apple M5 Neural Accelerator対応推論ランタイムBaseRT──llama.cpp比最大6.4倍のスループットを実現

07-24🔥🔥

SLPO:潜在推論に強化学習を導入しテスト時スケーリングを実現する手法

07-24🔥🔥

金融感情分析のコストを削減するマルチエージェント手法TriAgent──GPT-4o-mini比で年間930万ドルのコスト削減

07-24🔥🔥

LRMの推論を最適化するEvoThink──冗長ステップの剪定と失敗からの学習で効率と精度を両立

07-24🔥🔥

250B MoEモデルSolar Open 2を公開──1Mトークン長文脈とエージェント特化学習で性能向上

07-23🔥🔥

AIの権力追求行動を測定するベンチマーク「SysAdmin」公開──7つのフロンティアモデルで検証

07-23🔥🔥

Attention-only Transformerの性能検証──FFNなしでもパラメータ再配分で同等性能を実現

07-23🔥🔥

LLMのドメイン横断推論を評価するRelay-Bench公開──GPT-5.5 (xHigh) のスコアは43.3%

07-23🔥🔥

LLMのJSON出力強制が回答多様性を低下──44モデルでモード回答率が41%から64%へ上昇

07-23🔥🔥

8BモデルでKGQAを実現するSearch-on-Graph-R1──SPARQL教師学習で推論コストを削減

07-22🔥🔥

RLHF選好データにおけるレーターステートバイアスの監査フレームワークを提案

07-22🔥🔥

マルチエージェントLLMの計画フェーズを狙う攻撃手法PlanFlip──GPT-5で成功率0.68を記録

07-22🔥🔥

AIエージェントの実行を完全再現するCLIフレームワーク「agrepl」──外部通信を遮断し再現率100%を達成

07-22🔥🔥

3B以下の小型言語モデル9種を評価・微調整するローカル展開向けベンチマーク手法

07-22🔥🔥

LLMエージェントの責任あるAI実装を自動修復するRAIL Guard──修復成功率96.9%を達成

07-21🔥🔥🔥

Chain-of-Thoughtの悪用でGPT-4.1の脱獄成功率が10倍に──推論トレース転送の脅威を実証

07-21🔥🔥

Large Reasoning Modelの拒絶応答はCoTと活性化の二重構造──DeepSeek-R1-Distill-LLaMA-8Bで実証

07-21🔥🔥

MLLM-DataEngine:マルチモーダル学習データ生成の閉ループ化手法

07-21🔥🔥

医療特化型LLM「Cura 1T」──人間介在型の自己進化ループで臨床推論とツール操作を統合

07-21🔥🔥

Xiaomi-Robotics-1:10万時間の実世界データで学習したVLAモデル、RoboCasa365で成功率57.6%を達成

07-20🔥🔥🔥

MCPにおけるUnicode TAGブロックを用いたツールメタデータ隠蔽手法──人間には不可視でモデルには到達

07-20🔥🔥

LLMエージェントのMCPサーバー適応力を評価するMCPEvol-Benchを公開──進化するツール環境で精度最大14.4%低下

07-20🔥🔥

RetroAgent:化学合成計画のための構造化メモリを活用したLLMエージェント

07-20🔥🔥

BPMN自動実行に特化した専門エージェント──汎用エージェント比でツール利用精度が最大20pt向上

07-20🔥🔥

Eコマース向けCatalogAgent:スーパーバイザー仲介によるLLMの自己学習システム

07-19🔥🔥

ToolAnchor:エージェントのツール利用能力を向上させる反事実的アンカーコンテキスト手法

07-19🔥🔥

Embodied AI向け基盤モデルRxBrain──言語と視覚的想像を統合した計画生成で実ロボット操作を実現

07-19🔥🔥

マルチエージェント型レッドチーミングによるハードケース自動生成手法──画像安全性ベンチマークでFNRを16.7pt削減

07-19🔥🔥

報酬不要の自己進化エージェントを実現するペアワイズバリデーター手法

07-19🔥🔥

Muon最適化手法の幾何学的特性を解明するMuse──行列表現が学習ダイナミクスに与える影響を分析

07-18🔥🔥

HG-RAG:階層型知識グラフを用いたRAGフレームワーク──グラフ探索により多ホップ推論精度を向上

07-18🔥🔥

Token Time Continuous Diffusion:トークンごとの時間制御で高速生成時の精度を維持

07-18🔥🔥

Diffusion LLMの推論を高速化するPolestar──KVキャッシュ再利用とトークンコミットを最適化

07-18🔥🔥

LLMエージェントのツール利用効率を定量化する指標「限界ツール効用(MTU)」を提案

07-18🔥🔥

LLMの信頼性上限を理論的に解明──タスク固有の曖昧さと依存関係カーネルによるスケーリング則の再定義

07-17🔥🔥

テキストデータセット蒸留手法TAKE──元データの0.1%まで圧縮しつつ推論精度を維持

07-17🔥🔥

LLM活用都市シミュレーション基盤CityBehavEx──10万エージェントを1時間で処理可能

07-16🔥🔥

LLMの点字翻訳能力を検証──韓国語点字で既存モデルは軒並み低精度、小規模モデルのSFTが有効

07-16🔥🔥

線形AttentionのKVキャッシュを回転行列で制御する手法SFDA──循環的記憶学習で精度向上

07-16🔥🔥

LLaMA 3をRAG向けリランカーへ転用する手法──従来比で精度最大21%向上

07-16🔥🔥

高次元空間の性質を利用する高速なIndexer-TopKカーネル「LiteTopK」──GLM-5.2で1.2倍の高速化を実現

07-15🔥🔥

進化計算アルゴリズム DCF2D を発表──制約付き多目的最適化で双方向デカップリングを実現

07-15🔥🔥

AuditWeave、AI ワークフローの証跡を保証する改ざん検知ライブラリを発表──ハッシュチェーンで RAG 経路を完全追跡

07-14🔥🔥

EHR データ向けマルチモーダル対照学習モデルを提案──臨床コードと非構造化テキストの相乗効果を数理的に証明

07-12🔥🔥

DeepSearch-World、Web検索エージェント向け自己進化環境を公開──42万件の検証可能タスクでSOTA級性能を実現

07-11🔥

Conformal Predictive Programming、確率制約付き最適化を決定論的解法へ変換する新フレームワーク

07-10🔥🔥

AgentLens、コーディングエージェント評価用ベンチマークを公開──成功判定だけでなく実行過程を詳細分析

07-09🔥🔥

Apple、LLM ファインチューニング最適化手法 DynaMiCS を発表──制約条件付きの混合学習を自動化

07-09🔥🔥

Apple、VLM 推論フレームワーク LensVLM を公開──画像圧縮下で 10.1 倍の効率化を実現

07-09🔥🔥

Apple、マルチターン画像編集モデル MT-EditFlow を発表──FLUX.1-dev 比で精度 6.85 ポイント向上

07-09🔥

論文:平均・分散・尖度制約下での最悪ケース裾確率を導出──4つのレジームで構成される相図を提示

07-08🔥🔥

Google、Gemma 4 モデルシリーズを発表──2.3Bから31BのMoE構成で推論とマルチモーダル性能を強化

07-07🔥🔥

Apple、アノテーターの安全性判断を可視化する「Annotator Policy Models」を公開

07-07🔥🔥

Apple、ASR 誤り訂正用モデル Revisiting ASR Error Correction を発表──LLM 比 1/15 のサイズで高精度を実現

07-07🔥🔥

Apple、検索・推薦モデルの推論安定化フレームワーク「Fortress」を公開──特徴量剪定で精度と安定性を両立

07-07🔥🔥

Apple、MoE モデルの推論効率を高めるアーキテクチャ「PathMoE」を発表

07-07🔥🔥

Apple、連続拡散モデルによる音声言語モデルの学習則を解明──16Bパラメータで多言語・感情表現を実現

07-04🔥

arXiv、バンドル販売データから消費者選好を推定する統計モデルを提案

07-03🔥🔥

BaseRT、Apple Silicon 向け推論ランタイムを公開──llama.cpp 比で最大 1.56 倍の高速化を実現

07-02🔥🔥

カーボンアウェア・スケジューリングにおける DRL ベースの動的アルゴリズム設定手法を提案

07-01🔥🔥

MSC-CMA-ES、CMA-ES の再起動戦略を最適化するクラスタリング手法を提案──組成関数で BIPOP-CMA-ES 比 2.7 倍のターゲットカバー率を達成

07-01🔥

Microsoft、エージェント用メモリフレームワーク Memora を発表──長期間の文脈保持と推論効率を両立

2026 · Jun

06-30🔥

ResNet の学習ダイナミクスを解明──Wasserstein 空間上の測地線を学習する数学的根拠を提示

06-28🔥

研究:LLM の追従性を制御する「Cascading Linear Features」手法を公開

06-27🔥

arXiv 論文、DNN の学習ダイナミクスを解明する「Frequency Principle」を理論化

06-26🔥🔥

ML-GSAI、拡散モデルベースの言語モデル iLLaDA を公開──LLaDA 比で数学・コード性能が大幅向上

06-25🔥🔥

Alibaba、言語世界モデル Qwen-AgentWorld 公開──7領域のシミュレーションと強化学習を支援

06-25🔥🔥

米研究者ら、エージェントAI向け動的レッドチーム評価ベンチマーク「RIFT-Bench」を開発

06-23🔥

LoRA学習への指数移動平均(EMA)導入によりLLM微調整の汎化性能と安定性が向上

06-23🔥

行列型再帰ユニット (MRU) が Transformer に匹敵する長文脈処理を実現──線形計算量で連想記憶を保持

06-21🔥🔥

CNN・Transformer・RNNを統合──学習可能な『積分変換』で全アーキテクチャを単一モデル化

06-20🔥🔥

LLMの内省による自己アライメント──外部ジャッジなしで倫理的逸脱を抑制

06-16🔥🔥

開発エージェントの対話能力を測る Dialogue SWE-Bench ──コーディング性能との乖離を指摘

06-13🔥🔥

LLM 推論スタックの自動最適化において Arbor が木探索によりスループットを最大 193% 向上

06-10🔥

空間イベント解析の二重確率点過程において計算効率と予測精度を両立する半パラメトリック手法

06-09🔥

非同一分布のサンプル共分散行列におけるレゾルベントの決定論的等価体への収束を厳密に証明

06-07🔥🔥

マルチエージェント間の通信を「行動と状態」に構造化し、SWE-agent のトークン消費を 50% 削減

06-04🔥🔥

PyTorch で微分代数方程式(DAE)を安定して解く──Index Reduction と随伴変数法で物理制約の学習を効率化

06-02🔥🔥

LLM の電子透かしは複数モデルのアンサンブルで無効化──3 モデルの平均で検知不能に

2026 · May

05-24🔥🔥

Transformer のメモリ律速を解消──非 Attention 演算を GEMM 後処理として統合する CODA

05-22🔥🔥

LLM 学習の不安定性を防ぐ統治レイヤー LBW-Guard ── 高学習率下でも Perplexity を 1885 から 11 へ劇的に安定化

05-21🔥🔥

LLM 分散学習の並列構成を秒単位で動的変更──235B モデルの再構成を 1000 倍高速化

05-19🔥🔥🔥

長文脈 LLM における RoPE の本質的限界──文脈長増大で位置とトークンの識別不能性が 0.5 に収束

05-18🔥

脳腫瘍検出の画像診断において Vision Transformer が CNN を凌駕──識別精度と感度の比較検証

05-17🔥

LLMエージェントの制御をDAGで決定論的に行い、幻覚ゼロとGAIA精度67.6%を実現

05-16🔥🔥🔥

LLM へのタスク委譲でドキュメントが破損──20 回の反復で情報の忠実性が最大 34% 低下

05-16🔥

高次元幾何学が MRI 撮影を劇的に高速化──圧縮センシングによる医療診断の変革

05-15🔥🔥

2つのLLMを中間層で直接結合し、テキストを介さずツール利用や推論を並列化

05-14🔥🔥

視覚言語モデルの信頼性はアテンションでは測れない──隠れ状態の幾何構造が正誤を AUROC 0.95 で予測

05-13🔥🔥

乳腺病理診断の全工程を支援する基盤モデル BRAVE ── 陰性症例の 7 割以上を安全に自動除外

05-12🔥🔥🔥

100万時間の人間行動動画データ「HumanNet」がロボット学習を加速──実機データ10倍分に匹敵

05-11🔥🔥

LLM 性能評価の非線形性を実証──「A > B かつ B > C ならば A > C」の推移律は成立せず

05-11🔥🔥

動画 VLM の長尺推論を効率化──質問との関連度に基づく混合精度量子化で KV Cache を削減

05-10🔥🔥

DeepSeek-V4 が FP4 量子化意識学習(QAT)を実用化──10兆トークン規模の MoE 学習安定化手法を公開

05-10🔥

腫瘍学の意思決定支援を 2 段構えのマルチエージェントで高度化──プライバシー保護と根拠性を両立

05-08🔥🔥

サイバー防衛 LLM エージェントの安定性を Lean 4 で形式証明──攻撃者の利得を 59% 削減

05-07🔥🔥

LLM の「意図しない有害化」は特徴量の幾何学的近接性が原因──幾何学フィルタリングで 34.5% 改善

05-05🔥

因果グラフ未知でも複数環境データから因果効果を二重に堅牢に推定する手法 RAMEN

05-02🔥🔥

複数カメラの人物追跡で「ゴースト」をリアルタイム抑制──自己校正ホモグラフィで位置合わせを自動化

2026 · Apr

04-30🔥🔥

逐次的な推論タスクにおける現行 AI の限界──「直列スケーリング仮説」が示す並列化の壁

04-30🔥🔥

LLM の制御可能性とドリフトを「幾何学的安定性」で予測──ステアラビリティ予測精度 ρ=0.97

04-30🔥🔥

LLM の安全性は「1単語ずつの生成」で崩壊する──ICD 手法が既存ベンチマークで高い攻撃成功率を記録

04-29🔥🔥

マルチモーダル LLM「Nemotron 3 Nano Omni」が音声対応とトークン削減で推論効率を大幅改善

04-29🔥

離散ベイズネットワークのパラメータ爆発を階層的ディリクレ収縮で抑制──疎なデータでの推定精度を改善

04-29🔥

ネットワークのコミュニティ検出を非負値行列因子分解で高速化──100万エッジを4分で処理

04-29🔥

Text-to-SQL の複雑なクエリ生成を並列テストケース探索で改善、Spider 2.0 で 70.2% の SOTA 達成

04-28🔥

LLM の「ランダム性の底」を特定──非ランダム性の 9 割は文脈ではなくモデル重みに起因

04-28🔥

電力系統の状態推定における虚偽データ注入攻撃(FDIA)を物理法則(PINN)と不確実性重み付けで防御

04-28🔥

マルチエージェント LLM の報酬割当を改善する CoFi-PGMA ── 反実仮想的な勾配更新で学習信号の歪みを補正

04-28🔥

Transformer の第 0 層保護で圧縮効率を劇的に改善──パラメータ 60% 削減でも性能維持

04-25🔥

CPDAG から DAG を高効率に導出する非線形因果探索アルゴリズムを提案

04-25🔥

低ランク回帰タスクにおけるTransformerのインコンテキスト学習メカニズムを理論的に解明

04-25🔥

MMAF-guided learningによる時空間予測で浅層ネットワークが拡散モデルを凌駕

04-24🔥🔥

Can We Locate and Prevent Stereotypes in LLMs?

04-24🔥🔥

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs