📁 Category

papers · 110 topics

学術論文 (arXiv / 会議 / 研究機関ブログ)

2026 · Jul

07-23🔥🔥

AIの権力追求行動を測定するベンチマーク「SysAdmin」公開──7つのフロンティアモデルで検証

07-23🔥🔥

Attention-only Transformerの性能検証──FFNなしでもパラメータ再配分で同等性能を実現

07-23🔥🔥

LLMのドメイン横断推論を評価するRelay-Bench公開──GPT-5.5 (xHigh) のスコアは43.3%

07-23🔥🔥

LLMのJSON出力強制が回答多様性を低下──44モデルでモード回答率が41%から64%へ上昇

07-23🔥🔥

8BモデルでKGQAを実現するSearch-on-Graph-R1──SPARQL教師学習で推論コストを削減

07-22🔥🔥

RLHF選好データにおけるレーターステートバイアスの監査フレームワークを提案

07-22🔥🔥

マルチエージェントLLMの計画フェーズを狙う攻撃手法PlanFlip──GPT-5で成功率0.68を記録

07-22🔥🔥

AIエージェントの実行を完全再現するCLIフレームワーク「agrepl」──外部通信を遮断し再現率100%を達成

07-22🔥🔥

3B以下の小型言語モデル9種を評価・微調整するローカル展開向けベンチマーク手法

07-22🔥🔥

LLMエージェントの責任あるAI実装を自動修復するRAIL Guard──修復成功率96.9%を達成

07-21🔥🔥🔥

Chain-of-Thoughtの悪用でGPT-4.1の脱獄成功率が10倍に──推論トレース転送の脅威を実証

07-21🔥🔥

Large Reasoning Modelの拒絶応答はCoTと活性化の二重構造──DeepSeek-R1-Distill-LLaMA-8Bで実証

07-21🔥🔥

MLLM-DataEngine:マルチモーダル学習データ生成の閉ループ化手法

07-21🔥🔥

医療特化型LLM「Cura 1T」──人間介在型の自己進化ループで臨床推論とツール操作を統合

07-21🔥🔥

Xiaomi-Robotics-1:10万時間の実世界データで学習したVLAモデル、RoboCasa365で成功率57.6%を達成

07-20🔥🔥🔥

MCPにおけるUnicode TAGブロックを用いたツールメタデータ隠蔽手法──人間には不可視でモデルには到達

07-20🔥🔥

LLMエージェントのMCPサーバー適応力を評価するMCPEvol-Benchを公開──進化するツール環境で精度最大14.4%低下

07-20🔥🔥

RetroAgent:化学合成計画のための構造化メモリを活用したLLMエージェント

07-20🔥🔥

BPMN自動実行に特化した専門エージェント──汎用エージェント比でツール利用精度が最大20pt向上

07-20🔥🔥

Eコマース向けCatalogAgent:スーパーバイザー仲介によるLLMの自己学習システム

07-19🔥🔥

ToolAnchor:エージェントのツール利用能力を向上させる反事実的アンカーコンテキスト手法

07-19🔥🔥

Embodied AI向け基盤モデルRxBrain──言語と視覚的想像を統合した計画生成で実ロボット操作を実現

07-19🔥🔥

マルチエージェント型レッドチーミングによるハードケース自動生成手法──画像安全性ベンチマークでFNRを16.7pt削減

07-19🔥🔥

報酬不要の自己進化エージェントを実現するペアワイズバリデーター手法

07-19🔥🔥

Muon最適化手法の幾何学的特性を解明するMuse──行列表現が学習ダイナミクスに与える影響を分析

07-18🔥🔥

HG-RAG:階層型知識グラフを用いたRAGフレームワーク──グラフ探索により多ホップ推論精度を向上

07-18🔥🔥

Token Time Continuous Diffusion:トークンごとの時間制御で高速生成時の精度を維持

07-18🔥🔥

Diffusion LLMの推論を高速化するPolestar──KVキャッシュ再利用とトークンコミットを最適化

07-18🔥🔥

LLMエージェントのツール利用効率を定量化する指標「限界ツール効用(MTU)」を提案

07-18🔥🔥

LLMの信頼性上限を理論的に解明──タスク固有の曖昧さと依存関係カーネルによるスケーリング則の再定義

07-17🔥🔥

テキストデータセット蒸留手法TAKE──元データの0.1%まで圧縮しつつ推論精度を維持

07-17🔥🔥

LLM活用都市シミュレーション基盤CityBehavEx──10万エージェントを1時間で処理可能

07-16🔥🔥

LLMの点字翻訳能力を検証──韓国語点字で既存モデルは軒並み低精度、小規模モデルのSFTが有効

07-16🔥🔥

線形AttentionのKVキャッシュを回転行列で制御する手法SFDA──循環的記憶学習で精度向上

07-16🔥🔥

LLaMA 3をRAG向けリランカーへ転用する手法──従来比で精度最大21%向上

07-16🔥🔥

高次元空間の性質を利用する高速なIndexer-TopKカーネル「LiteTopK」──GLM-5.2で1.2倍の高速化を実現

07-15🔥🔥

進化計算アルゴリズム DCF2D を発表──制約付き多目的最適化で双方向デカップリングを実現

07-15🔥🔥

AuditWeave、AI ワークフローの証跡を保証する改ざん検知ライブラリを発表──ハッシュチェーンで RAG 経路を完全追跡

07-14🔥🔥

EHR データ向けマルチモーダル対照学習モデルを提案──臨床コードと非構造化テキストの相乗効果を数理的に証明

07-12🔥🔥

DeepSearch-World、Web検索エージェント向け自己進化環境を公開──42万件の検証可能タスクでSOTA級性能を実現

07-11🔥

Conformal Predictive Programming、確率制約付き最適化を決定論的解法へ変換する新フレームワーク

07-10🔥🔥

AgentLens、コーディングエージェント評価用ベンチマークを公開──成功判定だけでなく実行過程を詳細分析

07-09🔥🔥

Apple、LLM ファインチューニング最適化手法 DynaMiCS を発表──制約条件付きの混合学習を自動化

07-09🔥🔥

Apple、VLM 推論フレームワーク LensVLM を公開──画像圧縮下で 10.1 倍の効率化を実現

07-09🔥🔥

Apple、マルチターン画像編集モデル MT-EditFlow を発表──FLUX.1-dev 比で精度 6.85 ポイント向上

07-09🔥

論文:平均・分散・尖度制約下での最悪ケース裾確率を導出──4つのレジームで構成される相図を提示

07-08🔥🔥

Google、Gemma 4 モデルシリーズを発表──2.3Bから31BのMoE構成で推論とマルチモーダル性能を強化

07-07🔥🔥

Apple、アノテーターの安全性判断を可視化する「Annotator Policy Models」を公開

07-07🔥🔥

Apple、ASR 誤り訂正用モデル Revisiting ASR Error Correction を発表──LLM 比 1/15 のサイズで高精度を実現

07-07🔥🔥

Apple、検索・推薦モデルの推論安定化フレームワーク「Fortress」を公開──特徴量剪定で精度と安定性を両立

07-07🔥🔥

Apple、MoE モデルの推論効率を高めるアーキテクチャ「PathMoE」を発表

07-07🔥🔥

Apple、連続拡散モデルによる音声言語モデルの学習則を解明──16Bパラメータで多言語・感情表現を実現

07-04🔥

arXiv、バンドル販売データから消費者選好を推定する統計モデルを提案

07-03🔥🔥

BaseRT、Apple Silicon 向け推論ランタイムを公開──llama.cpp 比で最大 1.56 倍の高速化を実現

07-02🔥🔥

カーボンアウェア・スケジューリングにおける DRL ベースの動的アルゴリズム設定手法を提案

07-01🔥🔥

MSC-CMA-ES、CMA-ES の再起動戦略を最適化するクラスタリング手法を提案──組成関数で BIPOP-CMA-ES 比 2.7 倍のターゲットカバー率を達成

07-01🔥

Microsoft、エージェント用メモリフレームワーク Memora を発表──長期間の文脈保持と推論効率を両立

2026 · Jun

06-30🔥

ResNet の学習ダイナミクスを解明──Wasserstein 空間上の測地線を学習する数学的根拠を提示

06-28🔥

研究:LLM の追従性を制御する「Cascading Linear Features」手法を公開

06-27🔥

arXiv 論文、DNN の学習ダイナミクスを解明する「Frequency Principle」を理論化

06-26🔥🔥

ML-GSAI、拡散モデルベースの言語モデル iLLaDA を公開──LLaDA 比で数学・コード性能が大幅向上

06-25🔥🔥

Alibaba、言語世界モデル Qwen-AgentWorld 公開──7領域のシミュレーションと強化学習を支援

06-25🔥🔥

米研究者ら、エージェントAI向け動的レッドチーム評価ベンチマーク「RIFT-Bench」を開発

06-23🔥

LoRA学習への指数移動平均(EMA)導入によりLLM微調整の汎化性能と安定性が向上

06-23🔥

行列型再帰ユニット (MRU) が Transformer に匹敵する長文脈処理を実現──線形計算量で連想記憶を保持

06-21🔥🔥

CNN・Transformer・RNNを統合──学習可能な『積分変換』で全アーキテクチャを単一モデル化

06-20🔥🔥

LLMの内省による自己アライメント──外部ジャッジなしで倫理的逸脱を抑制

06-16🔥🔥

開発エージェントの対話能力を測る Dialogue SWE-Bench ──コーディング性能との乖離を指摘

06-13🔥🔥

LLM 推論スタックの自動最適化において Arbor が木探索によりスループットを最大 193% 向上

06-10🔥

空間イベント解析の二重確率点過程において計算効率と予測精度を両立する半パラメトリック手法

06-09🔥

非同一分布のサンプル共分散行列におけるレゾルベントの決定論的等価体への収束を厳密に証明

06-07🔥🔥

マルチエージェント間の通信を「行動と状態」に構造化し、SWE-agent のトークン消費を 50% 削減

06-04🔥🔥

PyTorch で微分代数方程式(DAE)を安定して解く──Index Reduction と随伴変数法で物理制約の学習を効率化

06-02🔥🔥

LLM の電子透かしは複数モデルのアンサンブルで無効化──3 モデルの平均で検知不能に

2026 · May

05-24🔥🔥

Transformer のメモリ律速を解消──非 Attention 演算を GEMM 後処理として統合する CODA

05-22🔥🔥

LLM 学習の不安定性を防ぐ統治レイヤー LBW-Guard ── 高学習率下でも Perplexity を 1885 から 11 へ劇的に安定化

05-21🔥🔥

LLM 分散学習の並列構成を秒単位で動的変更──235B モデルの再構成を 1000 倍高速化

05-19🔥🔥🔥

長文脈 LLM における RoPE の本質的限界──文脈長増大で位置とトークンの識別不能性が 0.5 に収束

05-18🔥

脳腫瘍検出の画像診断において Vision Transformer が CNN を凌駕──識別精度と感度の比較検証

05-17🔥

LLMエージェントの制御をDAGで決定論的に行い、幻覚ゼロとGAIA精度67.6%を実現

05-16🔥🔥🔥

LLM へのタスク委譲でドキュメントが破損──20 回の反復で情報の忠実性が最大 34% 低下

05-16🔥

高次元幾何学が MRI 撮影を劇的に高速化──圧縮センシングによる医療診断の変革

05-15🔥🔥

2つのLLMを中間層で直接結合し、テキストを介さずツール利用や推論を並列化

05-14🔥🔥

視覚言語モデルの信頼性はアテンションでは測れない──隠れ状態の幾何構造が正誤を AUROC 0.95 で予測

05-13🔥🔥

乳腺病理診断の全工程を支援する基盤モデル BRAVE ── 陰性症例の 7 割以上を安全に自動除外

05-12🔥🔥🔥

100万時間の人間行動動画データ「HumanNet」がロボット学習を加速──実機データ10倍分に匹敵

05-11🔥🔥

LLM 性能評価の非線形性を実証──「A > B かつ B > C ならば A > C」の推移律は成立せず

05-11🔥🔥

動画 VLM の長尺推論を効率化──質問との関連度に基づく混合精度量子化で KV Cache を削減

05-10🔥🔥

DeepSeek-V4 が FP4 量子化意識学習(QAT)を実用化──10兆トークン規模の MoE 学習安定化手法を公開

05-10🔥

腫瘍学の意思決定支援を 2 段構えのマルチエージェントで高度化──プライバシー保護と根拠性を両立

05-08🔥🔥

サイバー防衛 LLM エージェントの安定性を Lean 4 で形式証明──攻撃者の利得を 59% 削減

05-07🔥🔥

LLM の「意図しない有害化」は特徴量の幾何学的近接性が原因──幾何学フィルタリングで 34.5% 改善

05-05🔥

因果グラフ未知でも複数環境データから因果効果を二重に堅牢に推定する手法 RAMEN

05-02🔥🔥

複数カメラの人物追跡で「ゴースト」をリアルタイム抑制──自己校正ホモグラフィで位置合わせを自動化

2026 · Apr

04-30🔥🔥

逐次的な推論タスクにおける現行 AI の限界──「直列スケーリング仮説」が示す並列化の壁

04-30🔥🔥

LLM の制御可能性とドリフトを「幾何学的安定性」で予測──ステアラビリティ予測精度 ρ=0.97

04-30🔥🔥

LLM の安全性は「1単語ずつの生成」で崩壊する──ICD 手法が既存ベンチマークで高い攻撃成功率を記録

04-29🔥🔥

マルチモーダル LLM「Nemotron 3 Nano Omni」が音声対応とトークン削減で推論効率を大幅改善

04-29🔥

離散ベイズネットワークのパラメータ爆発を階層的ディリクレ収縮で抑制──疎なデータでの推定精度を改善

04-29🔥

ネットワークのコミュニティ検出を非負値行列因子分解で高速化──100万エッジを4分で処理

04-29🔥

Text-to-SQL の複雑なクエリ生成を並列テストケース探索で改善、Spider 2.0 で 70.2% の SOTA 達成

04-28🔥

LLM の「ランダム性の底」を特定──非ランダム性の 9 割は文脈ではなくモデル重みに起因

04-28🔥

電力系統の状態推定における虚偽データ注入攻撃(FDIA)を物理法則(PINN)と不確実性重み付けで防御

04-28🔥

マルチエージェント LLM の報酬割当を改善する CoFi-PGMA ── 反実仮想的な勾配更新で学習信号の歪みを補正

04-28🔥

Transformer の第 0 層保護で圧縮効率を劇的に改善──パラメータ 60% 削減でも性能維持

04-25🔥

CPDAG から DAG を高効率に導出する非線形因果探索アルゴリズムを提案

04-25🔥

低ランク回帰タスクにおけるTransformerのインコンテキスト学習メカニズムを理論的に解明

04-25🔥

MMAF-guided learningによる時空間予測で浅層ネットワークが拡散モデルを凌駕

04-24🔥🔥

Can We Locate and Prevent Stereotypes in LLMs?

04-24🔥🔥

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs