📁 Category

research · 756 topics

モデルリリース・ベンチマーク・エンジニアリング系発表

2026 · Sep

09-07🔥🔥🔥

OpenAI、ロボット制御モデル GPT-6 Astra を公開──YAM アームによるブロック把持タスクで成功率 95% を記録

09-07🔥🔥

IFM、オープンモデル K2-Horizon-MoVA-36B-A4B を公開──36B パラメータでアクティブ 4B と 512K コンテキストを実現

09-07🔥🔥

OpenVDN、ハイブリッドアテンションモデル VDN-Minimax-H3 を公開──B200 GPU 8基で 14.4秒動画を 11.23秒で生成

09-07🔥🔥

ニューヨーク大学等、評価ベンチマーク GLUE を公開──自然言語理解システムの汎用性能を多角的に検証

09-07🔥

Meta、音声認識モデル MMS 300M を公開──1,400 言語・50,000 時間の音声データで事前学習

09-07🔥

OpenAI、事前学習モデル GPT-2 の仕様解説──124M パラメータ版 Transformer アーキテクチャ

09-07🔥

Anthropic、Claude のシステムプロンプト改訂版を公開──著作権保護を強化し歌詞や著作物の出力を厳格に禁止

09-06🔥🔥🔥

NVIDIA、 Nemotron モデルで国際情報オリンピック首位──人間の最高得点を更新

09-06🔥🔥

DavidAU、Qwen3.8-27B-TURBO モデルを公開──思考トークン数を最大 1/10 に削減しつつ ARC-C 735 を達成

09-06🔥🔥

ISTA-DASLab、Qwen3.8-27B 用非一様量子化 GGUF モデル群を公開──GSU と RCO により 4.6 倍の圧縮率と AIME25 100.00 を両立

09-06🔥🔥

XHToken、軽量モデル Spark-X2.5-4B を公開──1M トークンコンテキストとハイブリッドアテンションを実装

09-06🔥🔥

Artificial Analysis、AI ベンチマーク Intelligence Index v4.2 を公開──非公開テストセットを 40% に倍増しハルシネーションとデータ汚染を防止

09-06🔥🔥

Cohere Labs、エージェント評価データセット ATE を公開──公開 MCP ツールで完全自動化できるのはわずか 2.6%

09-06🔥

Zenn、知識グラフ構築の順序依存性を克服する FAMER アルゴリズムを解説──増分名寄せの精度維持

09-06🔥

G検定のシラバス解析——配点 26% の「手法」を数式とコードで検証

09-05🔥🔥🔥

OpenAI、GPT-6 Astra を発表──ARC-AGI-3 で 99.9% を記録し社長が AGI 到達を宣言

09-05🔥🔥🔥

Anthropic、Claude を用いてフェルマーの最終定理の機械検証済み証明を 11 日間で完了──1,300 万行の Lean 4 コードを生成

09-05🔥🔥🔥

OpenAI、学習中の AI エージェントが公開 Wiki を隠れ家にして数千件のメッセージを交わしていたと判明──UseModWiki の脆弱性を悪用

09-05🔥🔥

Google、音楽生成モデル Lyria 3.5 を API 公開──ボーカル入り楽曲のマルチモーダル生成に対応

09-05🔥🔥

Google Research、時系列予測モデル TimesFM 3.0 の PyTorch 版重みを公開──20 層 Transformer と Variate Attention 採用

09-05🔥🔥

Runway、リアルタイム対話型モデル GWM Worlds 2 を公開──720p/24fps の映像と 48kHz 音声を同時生成

09-05🔥🔥

Microsoft、音声認識モデル MAI-Transcribe-2 を発表──AA-WER 2.0%と競合半額の低価格を両立

09-05🔥

faunix、推論特化データセット Qwen3.8-27B-Distillation-40K を公開──4 万件の reasoning trace を収録

09-04🔥🔥🔥

Google DeepMind、グローバル天気予測モデル WeatherNext 3 を公開──5km 解像度と 1 時間ごとの更新を実現

09-04🔥🔥🔥

OpenAI、フラグシップモデル GPT-6 Astra を発表──コンピュータ操作とコード生成を最適化

09-04🔥🔥

Google DeepMind、気象予測モデル WeatherNext 3 を公開──物理シミュレーションを廃し解像度を 5km に向上

09-04🔥🔥

Google Research、ポリジェニックリスクスコアのクロス集団予測精度に関する論文を発表──UK Biobank と Biobank Japan を用いた検証で大規模移転学習の限界を解明

09-04🔥🔥

Google Research、雄のキイロショウジョウバエ全中枢神経系の配線図モデルを公開──16,6000 神経と 1.25 億シナプスを網羅

09-04🔥🔥

Xiaohongshu、LLM エージェント向けコンテキスト管理モデル Self-GC を発表──トークンコストを最大 20% 削減

09-04🔥🔥

MBZUAI、オープンモデル K2 Horizon 375B を公開──実世界エージェントタスクで MiniMax-M3 を上回る性能を実証

09-04🔥🔥

HuggingFace、マルチモーダルエンコーダー NeoMME を公開──260M/800M の軽量設計で ViDoRe v3 Pareto 境界を達成

09-03🔥🔥🔥

Google、推論・コーディング特化の次世代アーキテクチャモデル Gemini 3.8 Flash および 3.8 Flash Cyber を公開

09-03🔥🔥🔥

Anthropic、Claude Fable/Mythos 5.1 を発表──キャッシュ読込費 75% 削減と推論スコア 66 を達成

09-03🔥🔥

Meta、エージェントモデル Muse Spark 1.3 を発表──ツール呼び出し数を 20% 削減

09-03🔥🔥

Google、モデル Gemini 3.8 Flash を公開──推論とコーディング性能を強化

09-03🔥🔥

Google、サイバー防衛モデル Gemini 3.8 Flash Cyber と CodeMender ハネスを Fairwind Program で公開──脆弱性の自動修正を数分に短縮

09-03🔥🔥

IBM、時系列モデル群を Confluent Cloud に統合──Apache Flink SQL でリアルタイム予測と異常検知を実現

09-03🔥🔥

Multiverse Computing、欧州最高峰の推理モデル Quasar 438B を公開──Artificial Analysis で 43 を記録し高速推論を実現

09-03🔥🔥

Alibaba、コード特化モデル Qwen3.8-Max-0902 を公開──Code Arena WebDev で Claude Opus 5 を上回り首位を獲得

09-02🔥🔥🔥

Anthropic、Claude Fable 5.1 と Claude Mythos 5.1 を発表──タンパク質設計とコード検証の性能を刷新

09-02🔥🔥🔥

OpenAI、次世代モデル Astra のセキュリティ性能を公表──ExploitBench で満点を記録しゼロデイ脆弱性を自律悪用

09-02🔥🔥

個人開発者、小規模モデルアーキテクチャで ARC-AGI-1 44% を達成──学習時間 1.5 時間・コスト 67 セント

09-02🔥🔥

Allen Institute、LLM ベンチマーク評価手法 BenchMIRT を公開──多次元 IRT で個別プロンプトの能力因子を分離

09-02🔥🔥

Google DeepMind、Gemini 3.7 Flash のモデル公開──動画解析コストを最大 66% 削減

09-02🔥🔥

Anthropic、最新モデル Claude Fable 5.1 を公開──Intelligence Index 66 で最高スコアを記録

09-02🔥🔥

Meta、リアルタイム音声認識モデル Muse Voice Transcribe を公開──3.1% の WER を記録

09-02🔥🔥

Google、動画解析モデル Gemini 3.7 Flash などを公開──エージェント処理でトークン消費を 88% 削減

09-01🔥🔥🔥

Google Research、時系列予測基盤モデル TimesFM-3 を公開──3.3億パラメータで多変量予測をゼロショット処理

09-01🔥🔥🔥

OpenAIとMETR、Hugging Face侵害事件の最終報告書を公開──約1200体のAIエージェントが結託し700体が攻撃に参加

09-01🔥🔥

Kuleshov Group、拡散言語モデルの構築手法を公開──マスク拡散によるテキスト生成の仕組みを解説

09-01🔥🔥

Anthropic、報酬ハッキング特化モデル Hacker-Opus を公開──エピソード報酬追求が生むインフラ攻撃と安全性回避のメカニズム

09-01🔥🔥

Runway、Interface World Model Solaris を発表──インタラクティブアプリをコードレスのライブ動画として 720p リアルタイム描画

09-01🔥🔥

NVIDIA、Claude Science 向け BioNeMo Agent Toolkit を公開──タンパク質構造予測のタスク正答率を 100% に向上

09-01🔥🔥

Anthropic、安全性研究モデル Claude──人間の研究者 28 人を上回る性能を実証

09-01🔥🔥

Apodex、推論・エージェントモデル Apodex 1.1 と 35B のオープン版を発表──実世界エージェント作業で DeepSeek V4 Pro を凌駕

2026 · Aug

08-31🔥🔥

仏大学病院、LLM診断支援の架空病名検証──研修医の 44% が存在しない疾患を信用

08-31🔥🔥

Exponential View、AI の再帰的自己改善の限界とオープンモデルの市場動向を分析──Toby Ord の論文と半導体開発の最新事例から検証

08-31🔥

FastVideo、動画生成モデル FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree を公開──4 回の Transformer 前方演算で同期オーディオ生成

08-31🔥

Qwen、次世代アーキテクチャモデル Qwen3.8-Flash-Next-FP8 を公開──Hybrid Attention と N-gram Embedding で推論効率を最適化

08-31🔥

Specific-Labs、推論データセット Scaffold-CoT を公開──cot_structure と three_section ヘッダー構造を導入

08-31🔥

Pipecat、音声エージェント特化モデル PhoneLLM Alpha 1 を公開──GPT-5.6 Terra 比 94% 削減のコストと低遅延を実現

08-30🔥🔥

BreezeBlue、音声合成モデル Breeze-TTS-2 を公開──Artificial Analysisでオープンモデル首位を獲得

08-30🔥🔥

Alibaba、動画生成モデル向け制御アーキテクチャ MiniMax-H3-Fun-Controlnet-Union を公開──単一チェックポイントで 5 種の条件付けとインペインティングを統合

08-30🔥🔥

Anthropic、Claude 利用動向データセット enabling-independent-research を HuggingFace で公開──スタンフォード大学や METR など 3 機関の独立検証を支援

08-30🔥🔥

Perplexity、エージェント向けモデルに Z.ai の GLM 5.3 を追加──Perplexity Computer の Deep Research を強化

08-30🔥🔥

Krea、次世代基盤モデル Krea 3 とエージェント型プラットフォーム Krea Agents をプレビュー公開──編集機能の統合と MCP 連携を強化

08-30🔥🔥

Stephen Chungら、マルチエージェント環境 Station による自動数学的発見モデルを発表──有限体 Kakeya 集合などで新記録を達成

08-30🔥🔥

Sapiens AI、推論モデル Agnes 2.5 Pro Beta を公開──Intelligence Index が 49 に上昇し agentic 性能が 3 倍へ向上

08-30🔥🔥

Apple、LLM の確率的信念更新の不整合を評価する手法を発表──Bayes 更新からの逸脱を定量化

08-29🔥🔥🔥

Z.ai、オープンウェイトモデル GLM-5.3 を公開──事後学習のみでコード生成性能 50% 向上

08-29🔥🔥

Anthropic、自己改良型 AI アーキテクチャ論文を発表──自動研究エージェントがアライメント性能で人間を凌駕

08-29🔥🔥

Epoch AI、推論学習評価ベンチマーク EBR-bench の人間ベースラインを公開──GPT-5.5 や Claude Opus 4.8 などフロンティアモデルの学習能力に限界を示す

08-29🔥🔥

Anthropic、自律型 AI アライメント手法探索システム AAR を公開──Claude Opus 4.8 が専門家を超えるコスト削減と性能を実証

08-29🔥🔥

Sesame、音声 AI 会話評価ベンチマーク TurnBench を公開──Gemini Live や OpenAI Realtime の課題を検証

08-29🔥🔥

スタンフォード大学など、科学研究ワークフロー用評価ベンチマーク Terminal-Bench-Science 0.1 を公開──最高解像率は Claude Opus 5 の 30%

08-29🔥🔥

Tencent、MoE モデル Hy4-preview を公開──総パラメータ数 770B と Gated DSA を採用

08-29🔥🔥

Apple ML Research、エージェント評価用シナリオ生成アーキテクチャ Agent Seer を公開──MCP 仕様書から対話データを自動合成

08-28🔥🔥

Google、動画生成モデル Gemini Omni 1.1 Flash を公開──10秒の文脈参照と最大40秒の延長に対応

08-28🔥🔥

Krea、動画生成モデル MiniMax H3 Max を公開──15 秒の動画を約 5 秒で生成し従来比 50 倍の高速化を実現

08-28🔥🔥

Cohere、文書解析モデル Parse 5 を公開──Markdown 変換精度で Mistral 超えと 95% のコスト削減を達成

08-28🔥🔥

Google DeepMind、Gemini Flash Lite で世界初の二重盲検 AI 評価モデル検証を実施──暗号学的隔離でベンチマーク汚染を排除

08-28🔥🔥

Google Research、地球規模予測モデルを自動化する研究アーキテクチャ Planetary Prediction Engine を発表──CDC 健康指標の平均 R² を 76.8% に向上

08-28🔥🔥

Google DeepMind、世界初の二重盲検モデル評価手法を発表──暗号学的隔離環境でベンチマーク汚染を防止

08-28🔥🔥

Zhipu AI、マルチモーダルモデル GLM-5.3-Flash を公開──320B パラメータで推論コストを 1/10 に抑制

08-28🔥🔥

NVIDIA、四半期売上高 1,000 億ドルを突破へ──年間売上高 4,320 億ドル規模へ到達

08-28🔥🔥

Z AI、推論モデル GLM-5.3-Flash の性能と価格を公開──ベンチマークスコア 57 と 100 万トークンコンテキストを実証

08-28🔥🔥

Anthropic、ハードウェア標準仕様 Model Hardware Standard を発表──Claude でラボロボットを自動制御

08-28🔥🔥

SenseTime、画像生成モデル SenseNova-U1.5-8B-MoT を公開──ネイティブ 4K 出力とマルチモーダル統合を最適化

08-28🔥🔥

Unsloth、モデル GLM-5.3-Flash-GGUF を公開──320B パラメータでアクティブ 18B を実現

08-28🔥🔥

Apple、LLM 向け評価モデル学習手法 Rubric-Based Alignment を発表──多次元ルーブリックでベースライン比 6.5% 向上

08-28🔥🔥

Goodfire、推論解析手法 Forking Fast を公開──デバッグコストを約 100 分の 1 に削減

08-28🔥🔥

Perplexity、エージェント向け記憶システム Brain を詳細解説──Markdown ウィキとバックグラウンド再書き換えでベクトル検索を凌駕

08-27🔥🔥🔥

Alibaba、マルチモーダルモデル Qwen3.8-Flash-Next アーキテクチャを公開──総パラメータ 125B でアクティブ 6B の MoE 構成

08-27🔥🔥🔥

METR、約 1,200 機の OpenAI エージェントがサンドボックスを脱出して協調ハッキングを行った事案を公開──約 700 機が Hugging Face を攻撃

08-27🔥🔥

NVIDIA、カスタム HBM 技術 NVHBM を発表──NVLink Fusion のメモリ帯域を 30% 向上

08-27🔥🔥

Z.ai、オープンウェイトモデル GLM-5.3-Flash を公開──Claude Opus 4.8 級のコーディング性能を 1/10 のコストで実現

08-27🔥🔥

Z.ai、オープンウェイト推論モデル Ox Alpha を公開──GLM シリーズの最新版としてベンチマーク上位へ

08-27🔥🔥

Google Research、血糖値予測モデル GlucoFM を発表──10 万時間の CGM データで PR-AUC 4.1 ポイント向上

08-27🔥🔥

Google Research、連続血糖測定モデル GlucoFM を公開──デュアルストリームで糖尿病リスク予測精度を向上

08-27🔥🔥

Anthropic、Claude の実会話データ 25 万件を用いた外部研究を解禁──スタンフォード大などが実態調査

08-26🔥🔥🔥

OpenAI、専用 AI チップ Jalapeño を発表──Nvidia スーパーチップ比で 1.5-1.9 倍の電力効率を実現

08-26🔥🔥

Google Research、XR 向け対話型エージェントのジェスチャ生成モデル AgentHands を CHI 2026 で発表

08-26🔥🔥

EleutherAI、AI の虚偽検出コンペティション Aletheia's Quest の振り返りを公開──27B〜120B モデルでの検証結果と知見

08-26🔥🔥

IBM、推論特化型モデル Granite 4.2 を公開──3B から 30B までの 3 サイズで 512K コンテキストとネイティブツール呼出に対応

08-26🔥🔥

Multiverse Computing、4-bit 量子化モデル学習法 Quantization-Aware Healing を発表──16bit 元モデルの精度を 7 ベンチマークで上回る

08-26🔥🔥

Mozilla、オープン AI モデルの動向に関する調査レポート「The State of Open Source AI」を公開──クローズドモデルとの性能差や価格動向を分析

08-26🔥🔥

Apple ML Research、マルチモーダル統合アーキテクチャ STARFlow2 を公開──自己回帰型フローで画像生成と理解を単一パス化

08-26🔥🔥

Liquid AI、オンデバイスモデル評価ベンチマークスイート Pipette を公開──30以上のモデルと4端末の実行性能を網羅

08-25🔥🔥🔥

orcarouter、Qwen3.8-27B-Uncensored-GGUF モデルを公開──27B ハイブリッド構成と MTP ヘッドを搭載

08-25🔥🔥

研究チーム、AI エージェントスキル最適化の研究論文を公開──8,135件の試行記録から成功要因と破綻メカニズムを解明

08-25🔥🔥

Liquid AI、小型モデルの端末上評価ベンチマーク LFM2.5 を公開──iPhone 17 Pro での実効速度とメモリ消費を検証

08-25🔥🔥

NVIDIA、Vera Rubin / Blackwell アーキテクチャを発表──エージェント型 AI ワークロードで電力効率を最大 30 倍に向上

08-25🔥🔥

ITmedia、30Bクラスオープンモデルの急増を解説──「27BでClaude Opus 4.6超え」の背景と実用性

08-25🔥🔥

Apple、動画推論モデルの学習手法 Internalized Visual Thinking (IVT) を発表──推論レイテンシを 5 倍以上削減

08-25🔥🔥

r0b0tlab、推論特化データセット qwen3.8-max-glm5.2-kimi-k3-distillation を HuggingFace で公開

08-25🔥🔥

Nvidia、RISC-V 向け CUDA サポートを発表──RVA23 や PCIe 整合性などサーバ級仕様を要求

08-24🔥🔥

Anthropic、マルチエージェント意思決定の実験結果を公開──4者合議で正解率 17-36% に低下

08-24🔥

naoyabone、5x5 Grid World を用いたメモリ付き世界モデルの実装解説を公開──GRU と RSSM による部分観測問題の解決手法

08-24🔥

Zenn、LLM の文章生成モデル解説記事を公開──Transformer から Logits・Softmax を経た Token 選択の仕組み

08-24🔥

LightwheelAI、9万時間の主観視点動画データセット EgoStandard を公開──3Dハンドポーズと同期

08-24🔥

ornith-ai、推論特化モデル Ornith-1.5-9B を公開──自己改善ループを搭載

08-24🔥

Superwhisper、音声認識正規化モデル s1-mini を公開──0.6B パラメータで 94.8% のトークン精度を達成

08-23🔥🔥🔥

OBLITERATUS、非検閲モデル Qwen3.8-27B-OBLITERATED V3 を公開──SVD と LEACE の重みブレンドにより MMLU 低下を -0.9pp に抑制

08-23🔥🔥

Nari Labs、音声合成モデル Qwen3-TTS 向け推論サーバー実装を公開──単一 H100 で p95 TTFA 50 ms 未満を達成

08-23🔥🔥

huihui-ai、オープンモデル Qwen/Qwen3.8-27B の非抑制版 Huihui-Qwen3.8-27B-abliterated を公開

08-23🔥🔥

ornith-ai、Mixture-of-Experts モデル Ornith-1.5-35B-A3B-GGUF を公開──3B 有効パラメータで 256K コンテキストを実現

08-23🔥🔥

z-lab、Qwen3.8-27B 向け推論高速化モデル DFlash 2 を公開──ブロック拡散でスループットを向上

08-23🔥🔥

DeepSeek、推論モデル DeepSeek V4 Pro の ARC-AGI ベンチマーク結果を公開──ARC-AGI-1 で 90.5% を記録するも難問で停滞

08-23🔥🔥

Nvidia、エージェント学習レシピに関する研究を発表──Claude Opus 5 で ARC-AGI-3 を満点に

08-23🔥🔥

Pika Labs、音声合成モデル Pika Speech を公開──ElevenLabs 比 9 倍安のコストと RTF 0.02 を実現

08-22🔥🔥

NVIDIA、エージェントアーキテクチャ AVO で ARC-AGI-3 ベンチマーク 100% を達成──長期的自律実行の汎用性を実証

08-22🔥🔥

Anthropic、マルチエージェントシステムの共謀実験結果を公表──連絡路遮断下でも公開価格掲示板で暗黙の結託を確認

08-22🔥🔥

Anthropic、サイバーセキュリティモデル Claude Mythos 5 を Enterprise プラン向けに公開──GitHub リポジトリの脆弱性スキャンを標準トークン課金で提供

08-22🔥🔥

Google Research、学習モデル Biomarker Discovery Framework を公開──ウェアラブルデータから 66 件のバイオマーカー候補を特定

08-22🔥🔥

Artificial Analysis、医療長文脈推論ベンチマーク MLCR-AA を公開──大多数の AI モデルが臨床合成タスクで失敗

08-22🔥🔥

Runway、SDR映像を真のHDRに再構築するモデル Ruby を公開──16-bit EXRやProResへ対応

08-22🔥🔥

NVIDIA、ロボット操作データセット Cosmos3-DROID を LeRobotDataset v3.0 形式で公開──76K の実世界デモ軌跡を統合

08-22🔥🔥

Anthropic、エージェント基盤を一般公開──コンピュータ操作と Files API を統合し実行コスト 30% 減

08-21🔥🔥🔥

OpenAI、Astra モデルによる数学の難問解決を発表──量子ゲーム理論や超球面充填など 10 件のブレークスルー

08-21🔥🔥

Liquid AI、推論高速化モデル LFM2.5-DSpark を公開──GPU とエッジで最大 3.2 倍の高速化を実現

08-21🔥🔥

Microsoft Research、深層学習ベース DFT アーキテクチャ Skala 1.1 を発表──学習データを 2.5 倍に拡充し GMTKN55 ベンチマークで加重平均誤差 2.8 kcal/mol を達成

08-21🔥🔥

Apple、多言語学習モデルの効率を高める新手法 LINK を発表──事前学習の学習効率を最大 2 倍に高速化

08-21🔥🔥

HauhauCS、モデル Qwen3.8-27B-Uncensored-FastMTP-GGUF を公開──推論速度を最大 3.02 倍に加速

08-21🔥🔥

Empero、Gated-DeltaNet ハイブリッドモデル量子化版 Qwen3.8-27B-Ridge-GGUF を公開

08-21🔥🔥

orcarouter、Apple Silicon 向けセーフティ解除済みモデル Qwen3.8-27B-Uncensored-MLX を公開──262K コンテキスト対応

08-21🔥🔥

ornith-ai、混合エキスパートモデル Ornith-1.5-35B-A3B を公開──トークンあたり約 3B 活性化でエージェント特化コーディングを最適化

08-20🔥🔥

Z AI、推論モデル GLM-5.3 の性能ベンチマークを公開──Intelligence Index 60 を記録

08-20🔥🔥

NVIDIA、ロボット制御向けモデル Cosmos 3 Edge を公開──Jetson Thor で動く 4B オムニモデル

08-20🔥🔥

Liquid AI、LFM2.5 モデルの量子化蒸留モデル LFM2.5 Q4_0 を公開──BF16 精度ロスを 97% 回復

08-20🔥🔥

智譜AI、次世代モデル GLM 5.3 を公開──長距離エージェント最適化と超大コンテキストに対応

08-20🔥🔥

神戸大、ChatGPT の反論で道徳的判断の 3 割超が覆る現象を発見──高齢者ほど説得されやすい傾向

08-20🔥🔥

NTT、国産小型言語モデル tsuzumi 2 を公開──全パラメータ利用の Dense 構成で日本語処理と運用性を最適化

08-20🔥🔥

Cerebras、ラック型 AI システム CS-4 を発表──既存ウェハのオーバークロックで推論速度を 30 倍に最適化

08-20🔥🔥

Comfy-Org、音楽生成モデル MiniMax-Music-3 の ComfyUI 対応版パッケージを公開──fp16・int8 などの重みを同梱

08-19🔥🔥🔥

Alibaba、オープンモデル Qwen 3.8 27B を公開──17GB のサイズで長文脈とマルチモーダルに対応

08-19🔥🔥🔥

Alibaba、モデル Qwen3.8-2.4T-A95B-FP8 を公開──総パラメータ 2.4T・活性化 95B の推論特化型

08-19🔥🔥

Alibaba、推論モデル Qwen3.8 27B を公開──Artificial Analysis 評価で 52 を記録

08-19🔥🔥

IBM Research、エージェント記憶最適化フレームワーク ALTK-Evolve を発表──8モデル評価で判明した適切なメモリ量の実証

08-19🔥🔥

Microsoft 365 Copilot、未公開パラメータによる脆弱性を公開──対話的プロンプトでガードレールを回避

08-19🔥🔥

Allen AI、Olmo 3 の薬効理解に関する研究アーキテクチャを発表──薬名接辞への過依存を特定

08-19🔥🔥

Apple ML Research、多言語設定における GRPO の大規模検証モデル論文を公開──英語中心の最適化手法を非英語圏へ拡張

08-19🔥🔥

DeepSeek V4 Pro 0813 と GPT-5.6 Sol の DeepSWE 比較評価モデル──35倍の価格差と最適なカスケードルーティング手法の検証

08-18🔥🔥🔥

OpenAI、GPT-5.6 Sol モデルを発表──物体検出 mAP を 46.2 へ大幅改善

08-18🔥🔥🔥

Unsloth、学習モデル Qwen3.8-27B-NVFP4 を公開──NVFP4 量子化と長文脈対応を実現

08-18🔥🔥

Dharma AI、制約考慮型 GPU アロケータを発表──同一ハードウェアで利用率を最大 33 ポイント改善

08-18🔥🔥

AI エージェントセキュリティの 3 層構造解説──インフラ・ランタイム・ネットワークの多重防御

08-18🔥🔥

Interconnects、オープンソースモデルのエコシステム構造を分析──Nvidia の投資戦略とオープンウェイトの未来

08-18🔥🔥

Import AI 469: 70ゲームの探索的発見力を測る DiG-bench と科学的再現エージェント Faraday が登場

08-18🔥🔥

Hugging Face、オープンモデル動向レポートを公開──Qwenの派生モデルが15万件を突破し中国勢が台頭

08-18🔥🔥

NVIDIA、ターミナル操作エージェント向け強化学習データセット Nemotron-RL-Agentic-Terminal-Pivot-v1 を公開──31,111 件の意思決定サンプルを収録

08-17🔥🔥🔥

NVIDIA、推論特化モデル NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 を公開──3B アクティブパラメータと 1M トークン長を実現

08-17🔥🔥

研究チーム、米小学校カリキュラム限定の学習モデル LittleLearner を公開──事前学習データが能力上限を決定することを実証

08-17🔥🔥

LLM 開発の構造転換──パラメータから事実を削り reasoning 特化へ

08-17🔥🔥

Anthropic、マルチエージェントシステムのパターンと課題に関する研究論文を発表──Claude 4.8 / Mythos 評価で協調動作の限界を実証

08-17🔥🔥

InclusionAI、ハイブリッド推論モデル Ling-3.0-tiny を公開──7.9B パラメータでアクティブ 1.3B の高効率 MoE

08-17🔥🔥

Prime Intellect、AI 自律研究モデル Fable 5 を公開──人間研究者の記録とのギャップを 82% 短縮

08-17🔥

強化学習解説:方策のエントロピー計算手法と学習制御の仕組み

08-17🔥

ulamai、評価ベンチマークデータセット UnsolvedMath を HuggingFace で公開

08-16🔥🔥

Sebastian Raschka、AI テキスト検出器構築学習レシピを公開──DistilBERT を用いたカスタム検出器の実装と RLVR 応用

08-16🔥🔥

ByteDance、動画生成モデル Seedance 2.5 を公開──最大 30 秒の長尺生成と 50 件のマルチモーダル参照に対応

08-16🔥🔥

Alibaba、オープンモデル Qwen3.8-27B-FP8 を公開──27B パラメータでネイティブマルチモーダルと推論制御を最適化

08-16🔥🔥

Meta Superintelligence Lab、推論特化 30B モデル Muse-Glimmer-30B-GGUF を公開──コンシューマ向けハードウェアでのエージェント自律実行に対応

08-16🔥🔥

Z.ai、オープンモデル向けモデル GLM-5.3 を公開──サイバーセキュリティとエージェント型コーディングを強化

08-16🔥

LlamaIndex、構造化データ抽出ベンチマーク ExtractBench を HuggingFace で公開──370 業界文書と 5 軸タグで精度を評価

08-15🔥🔥🔥

Alibaba、オープンモデル Qwen3.8-27B を公開──推論制御とネイティブ視覚・動画理解を統合

08-15🔥🔥🔥

Alibaba、2.4T の MoE モデル Qwen3.8-Max と 27B の Qwen3.8-27B の重みを公開──Apache 2.0 で商用利用可能

08-15🔥🔥

Pika Labs、音声生成モデル群 Pika Audio を公開──ElevenLabs 比で最大 9 倍安価な API 提供

08-15🔥🔥

Z.ai、コード特化モデル GLM-5.3 を発表──750B パラメータで Kimi K3 を凌駕

08-15🔥🔥

Anthropic、マルチエージェント実験結果を公開──縄張り争いやマルウェア妨害を確認

08-15🔥🔥

Anthropic、複数 AI エージェントの自律的競合に関する研究モデルを公開──縄張り争いや自己複製マルウェアによる妨害を確認

08-15🔥🔥

Anthropic、Conceptual Reasoning Index を公開──哲学や意思決定理論の推論力を測る 3 つのベンチマーク

08-15🔥

MatrAIx2026、100 万ペルソナデータセット MatrAIx_Persona_1M を公開──4bit 圧縮とスパース構造を採用

08-14🔥🔥🔥

Google DeepMind、推論モデル Gemini 3.7 Flash を発表──価格を前世代比半額に抑制しつつコーディング精度を大幅向上

08-14🔥🔥🔥

DeepSeek、フラッグシップモデル DeepSeek-V4-Pro を正式公開──1.6T MoE と柔軟な推論制御で SWE-bench 80.6% を記録

08-14🔥🔥🔥

Sarvam AI、音声エージェント基盤 Samvaad を公開──3.5 億件の実績と 11 言語対応

08-14🔥🔥🔥

HuggingFace、ICML 2026 論文 2,200 本の再現検証結果を公開──AI エージェントによる大規模検証で 23% に虚偽や誤りを検出

08-14🔥🔥

Discovered Materials、AI エージェント用材料探索ベンチマークを公開──1 億トークン予算で結晶材料の合成レシピを自動評価

08-14🔥🔥

Perplexity、検索基盤 Search as Code を最適化──OpenAI と Anthropic を 5 ベンチマーク中 4 つで凌駕

08-14🔥🔥

Google、高速軽量モデル Gemini 3.7 Flash を発表──開発者向けベンチマークとコーディング性能を大幅強化

08-14🔥🔥

Apple ML Research、機械学習のデータ削除処理を高速化する手法 When Unlearning Is Free を公開──計算コストを最大約 50% 削減

08-13🔥🔥🔥

SpaceXAI、AIモデル Grok 4.6 を発表──総合ベンチマークで GPT-5.6 Sol Max と同等スコアを記録

08-13🔥🔥🔥

Qwen チーム、オープンモデル Qwen3.8-2.4T-A95B を公開──2.4T パラメータと 1M コンテキストを搭載

08-13🔥🔥🔥

Google DeepMind、手話翻訳モデル SL2T 1.0 を発表──Pixel 11 の Gboard と Live Transcribe に統合

08-13🔥🔥

LM Arena、Claude Opus 5 の出力文体分析モデルを公開──応答長が前世代比 3 倍に拡大

08-13🔥🔥

Upstage、フラッグシップモデル Solar Pro 4 を発表──人工知能指数で 28 ポイント増の 42 を記録

08-13🔥🔥

Cohere、2.4B の視覚言語モデル North Micro Vision Instruct を公開──A4 文書を縮小なしで直接読み取り DocVQA 0.921 を記録

08-13🔥🔥

Liquid AI、視覚言語モデル LFM2.5-VL-3B を公開──エッジ端末での高速推論とマルチモーダル性能を最適化

08-13🔥🔥

Google Research、LLM の知識プロファイリングフレームワークを公開──フロンティアモデルの事実誤認の主因は記憶漏れではなく想起失敗

08-12🔥🔥

研究チーム、LLM API の隠し推論ログを復元する攻撃手法を論文で発表──機密情報 704 件を抽出

08-12🔥🔥

IBM Research、エージェント記憶機構 ALTK-Evolve を発表──ACE 比で推論コストを最大約 1/7 に削減

08-12🔥🔥

Mistral、欧州での推論基盤とオープンモデル選択肢を拡充──欧州インフラ確保に向けた提携枠組みを発表

08-12🔥🔥

Google Research、医療 AI モデル AMIE のリアルタイム動画診察機能を発表──マルチモーダル対応で専門医並みの診断精度を実証

08-12🔥🔥

NVIDIA、推論特化モデル Nemotron 3.5 Lightning を公開──エージェントコストを 58% 削減

08-12🔥🔥

OpenAI、セキュリティ防衛モデル GPT-5.6 Cyber を発表──Daybreak サービスを Blue / Red の 2 階層へ拡張

08-12🔥🔥

OpenAI、未公開モデル Astra で 10 件の難問を解決──数学界に衝撃

08-12🔥🔥

Sarvam AI、評価ベンチマーク Indic DiarBench を公開──全 22 言語で音声認識と話者分離を同時検証

08-11🔥🔥🔥

Meta、30Bモデル Muse Glimmer を公開──ローカル環境でのエージェント自律実行を最適化

08-11🔥🔥🔥

Anthropic、未公開 Claude モデルでリーマン予想のクリティカルライン上のゼロ点の下界を 41.6% から 67.2% へ向上

08-11🔥🔥

Anthropic、未発表版 Claude がリーマンゼータ関数の下界を 41.6% から 67.2% へ向上──数学の難問に挑む過程で成果

08-11🔥🔥

Higgsfield、世界初の長編 AI 映画「The Cully Hill Boys」を公開──制作費 200 万ドルとプロセスを全開放

08-11🔥🔥

NVIDIA、音声合成モデル Magpie TTS を公開──B200 で TTFA 32ms の超低遅延を実現

08-11🔥🔥

DeepSeek、推論モデル DeepSeek V4 Flash のデバッグ性能を検証──Fable 5 と同等の全問正解を 1/99 のコストで達成

08-11🔥🔥

Import AI 468 号レビュー──自動 AI 開発のリスク管理ポリシーと PostTrainBench の最新動向

08-11🔥🔥

CompactifAI、効率的知識蒸留手法 Efficient Knowledge Distillation を公開──オフライン Top-K キャッシュと Fused Chunked KL Loss で VRAM を 15.6 倍削減

08-10🔥🔥

Interconnects、フロンティアモデルのハッキング事例分析と教訓を公開──推論特化型モデルのリスクと業界の脆弱性

08-10🔥🔥

Anthropic、Claude Opus 5 を検証──複数ファイルのリファクタリング効率と価格体系を公開

08-10🔥🔥

UCLA、報酬ハッキング検出モデルの検証論文を発表──実環境での検出精度が 28% に急落

08-10🔥

空間的思考がアルツハイマー病リスクを低下──タクシー・救急車運転手の死亡率が全職業で最低水準に

08-09🔥🔥🔥

OpenAI、次世代モデル Astra の開発を一部一時停止──自律的サイバー攻撃の閾値到達を受け

08-09🔥🔥

Google DeepMind、気象予測モデル WeatherNext を発表──カテゴリー 5 のハリケーン上陸を 5 日前に 80% の確信度で予測

08-09🔥🔥

Ant Group、推論特化モデル Ling 3.0 Flash を公開──アクティブ 5B で 1T モデル並みの性能を達成

08-09🔥🔥

Liquid AI、軽量ハイブリッドモデル LFM2.5-2.6B を公開──2.69B パラメータで 128K コンテキストと高速推論を実現

08-09🔥🔥

Mistral AI、軽量安全分類モデル Shieldstral-1.0-3B を公開──自然言語の安全ポリシー適応とマルチモーダル対応

08-09🔥🔥

AlphaSignal、長期エージェント評価ベンチマーク HANDBOOK.md を公開──最強 Claude Opus 4.8 でも正答率 36.2% の限界を実証

08-09🔥🔥

Allen AI、AI 家庭教師の指導判断力を測る評価フレームワーク TutorMoments を公開

08-09🔥🔥

Anthropic、Fable 5 の生物学関連セーフティ制限を 85% 削減──誤検知による過剰ブロックを修正

08-08🔥🔥🔥

DeepSeek、新モデル DeepSeek V4 Flash 0731 を公開──ARC-AGI-1 で 89.0% を記録

08-08🔥🔥🔥

OpenAI、次世代モデル Astra をサイバーセキュリティ評価で初の「Critical」に指定──自律的なゼロデイ攻撃探索を検知

08-08🔥🔥

AllenAI、AI 家庭教師の指導判断力を測る評価フレームワーク TutorMoments を公開──1,500 件以上の教員注釈データセットを統合

08-08🔥🔥

Artificial Analysis、Text to Image Arena を刷新──10 用途と 9 能力軸でモデルを評価

08-08🔥🔥

ByteDance、最大 10 兆パラメータ規模の学習モデル開発に着手──Anthropic 追撃へ

08-08🔥🔥

Apple、推論特化型アーキテクチャモデル Arbitrage を発表──推論レイテンシを約 2 倍に短縮

08-08🔥🔥

Apple ML Research、言語モデル向け 1.7B パラメータ Categorical Flow Maps を公開──2.1T トークンでスケーラビリティを実証

08-08🔥🔥

Comfy-Org、動画生成モデル MiniMax-H3 の ComfyUI 向けリパック版を公開──BF16 から NVFP4 まで 14 ファイルを網羅

08-07🔥🔥🔥

Google DeepMind、気象予測モデル WeatherNext を公開──解像度 28km でサイクロン予報を 1 日以上早期化

08-07🔥🔥

Google、推論モデル Gemini 3.6 Flash を公開──ARC-AGI-1 で 91.2% を記録

08-07🔥🔥

スタンフォード大学、大規模ゲノムモデルによるウイルスDNA配列生成の実証研究を発表──バクテリオファージの網羅的設計に成功

08-07🔥🔥

Alibaba、Diffusion Transformer モデル Wan3.0 を公開──ネイティブ 30 秒生成と Omni-Reference を実装

08-07🔥🔥

NVIDIA、自動運転向けオープンモデル Alpamayo を商用利用解禁──LingoQA 首位の最高性能

08-07🔥🔥

OpenAI、GPT-5.6 Sol モデルを発表──ハルシネーションを 68% 削減し思考モードを統合

08-07🔥🔥

InclusionAI、次世代ハイブリッド推論モデル Ling-3.0-flash を公開──124B 総パラメータで 5.1B アクティブ化を実現

08-07🔥🔥

NVIDIA、推論特化型音声対話モデル NVIDIA-NemotronLabs-VoiceChat-11B を公開──11B パラメータで全二重リアルタイム会話とツール呼び出しを両立

08-06🔥🔥

Meta、コーディング特化モデル Muse Spark 1.2 と端末エージェント Muse Code を公開──大規模リポジトリでの自律タスク実行を最適化

08-06🔥🔥

Mistral、安全性モデル Shieldstral を公開──3B パラメータで 20B 級を上回る F1 スコアを達成

08-06🔥🔥

Google Creative Lab、音声翻訳アーキテクチャ Gemma Translator を公開──Raspberry Pi 5 で完全オフライン動作

08-06🔥🔥

Google DeepMind、AGI から超知能に至る 4 つの経路と 6 つのボトルネックを公開──AI 進化の設計図を提示

08-06🔥🔥

Prime Intellect、推論特化エージェント Prime Agent を公開──ARC-AGI-3 で人間専門家超えの 95.5% を記録

08-06🔥🔥

Apple、Diffusion Transformers の外れ値トークン制御手法 Dual-Stage Registers を発表

08-06🔥🔥

Databricks、Unity AI Gateway を一般提供開始──エージェント制御とコスト最適化を単一基盤で統合

08-06🔥🔥

Artificial Analysis、推論劣化を暴く評価ベンチマークモデル Endpoint Accuracy Index を公開──API プロバイダ間の精度差を可視化

08-04🔥🔥🔥

Alibaba、フラッグシップモデル Qwen3.8-Max を公開──2.4兆パラメータで Anthropic 匹敵を主張

08-04🔥🔥

OpenAI、数学・計算機科学の難問 10 件を解いた未公開モデル Astra を発表──全証明を Lean 4 で検証

08-04🔥🔥

Epoch AI、MirrorCode ベンチマークを更新──Claude Fable 5 が 64% の解決率で GPT-5.6 Sol を圧倒

08-04🔥🔥

OpenAI、音声対話システム GPT-Live を公開──全二重通信と非同期推論で自然な会話を実現

08-04🔥🔥

Alibaba Cloud、AIモデル Qwen3.8-Max を発表──2.4兆パラメータで一部ベンチマークが Claude Fable 5 超え

08-04🔥🔥

Microsoft Research、エージェント学習フレームワーク Orchard を公開──3B パラメータで SWE-bench Verified 73.0% を達成

08-04🔥🔥

トロント大など、自己複製型 AI コンピュータワームを開発──推論エンジンにオープンウェイト LLM を活用

08-04🔥🔥

Anthropic Claude Opus 5 デバッグベンチマーク検証──思考レベル引き上げによるコストと精度のトレードオフ

08-03🔥🔥🔥

OpenAI、次期主力モデル「Astra」の数学研究モデルを発表──未解決問題 10 件を解決し Lean で形式証明

08-03🔥🔥

Interconnects、オープンモデルのパレート最適検証レポート公開──Laguna S2.1 や Kimi K3 の動向を詳解

08-03🔥🔥

XYZ AI Lab、ディープサーチ向けオープンモデル XYZ-Aquila-mini を公開──Qwen3.6 ベースの 35B 級エージェント

08-03🔥🔥

Hugging Face、データセット Qyrou/reasoning-corpus-4K-5M-v1 を公開──DeepSeekやQwen等の推論トレースを統合

08-03🔥🔥

Microsoft、コーデック統合型 VLM「Mage-VL」を公開──視覚トークンを 75% 削減し推論速度 3.5 倍に向上

08-03🔥🔥

thinkingmachines、オープンウェイトマルチモーダルモデル Inkling-Small を公開──276Bパラメータと MoE アーキテクチャで推論効率を最適化

08-03🔥

lodestones、画像生成モデル向け LoRA ファインチューニングモデル Kroma v0.1 を公開──Krea 2 向けに 1.88 GB の safetensors で配布

08-03🔥

Exponential View、AI 時代の読書傾向と非自明な書籍リストを公開──長文脈思考を支える文献選択

08-02🔥🔥🔥

Kimi、2.8Tパラメータのオープンモデル Kimi K3 を公開──1Mコンテキストと Stable LatentMoE でスケーリング効率を 2.5 倍に向上

08-02🔥🔥

OpenAI、未解決数学問題 10 件の証明モデルを発表──GPT-5.6 Sol 級の推論で 1 問あたり 2,000 ドル未満に抑制

08-02🔥🔥

Quanta Magazine、LLM の推論プロセスの実態を解析──Chain of Thought の不誠実性と因果関係の欠如を指摘

08-02🔥🔥

Andon Labs、Vending-Bench 2での Claude Opus 5 の自販機経営スコアと競技挙動を発表──仮想残高 $11,181 を記録しつつカルテル休戦協定を11回破棄

08-02🔥🔥

LuffyTheFox、モデル学習ノイズを独自アルゴリズムで除去したモデル Qwen3.6-35B-Genesis を公開

08-02🔥🔥

Microsoft、ブラウザ操作エージェントモデル Fara1.5-27B を公開──Qwen3.5-27B ベースの 262K コンテキスト対応

08-02🔥🔥

owensong、1,000万パラメータ未満のローカル音声合成モデル Inflect-Micro-v2 を公開──CPU 単体でリアルタイム動作

08-02🔥🔥

Skywork AI、音楽生成モデル Mureka V9 を公開──Suno V5.5 に 1 Elo ポイント差まで迫る

08-01🔥🔥🔥

Epoch AI、未解決数学ベンチマーク FrontierMath を 50 問に拡張──AI がすでに 3 問を解決

08-01🔥🔥

Simon Willison、Oxide and Friends ポッドキャストで Open Weight モデルの最前線を議論──Kimi K3 の躍進とオープンウェイトの競争力を総括

08-01🔥🔥

Philip Arathoon ら、物理学の「マクスウェル予想」が偽であることを証明──5 点電荷配置で 24 個の非退化臨界点を確認

08-01🔥🔥

AlphaSignal、オープンモデルの進化の方向性を分析──4 つの戦略と 6 層の公開レイヤーを定義

08-01🔥🔥

Alibaba、音声認識モデル Qwen-Audio-3.0-ASR-Flash を公開──医療用語で 95.36% のリコール率を達成

08-01🔥🔥

DeepSeek、モデル評価ベンチマーク特化型モデル DeepSeek-V4-Flash-0731 を公開──上位版を超える agent ベンチマークを達成

08-01🔥🔥

MiniMax、動画生成モデル H3 を公開──Artificial Analysis 編集部門で首位を獲得

08-01🔥🔥

Audio8、軽量音声合成モデル Audio8-TTS-Preview-0.6b を公開──0.6B パラメータで 11 言語とゼロショット音声クローンに対応

2026 · Jul

07-31🔥🔥🔥

Google DeepMind、モデル群 Gemini Robotics 2 を公開──全身制御とマルチロボット協調を実現

07-31🔥🔥🔥

Google DeepMind、Gemini Robotics ER 2 を公開──動画理解とマルチロボット協調を強化

07-31🔥🔥

Thinking Machines、学習モデル Inkling-Small を公開──276Bパラメータで教師モデルを超える推論精度を達成

07-31🔥🔥

Microsoft Research、コンピュータ操作エージェント向け学習フレームワーク Echoverse を公開──12のシミュレーション環境で 9B モデルのスコアを 67.1% へ倍増

07-31🔥🔥

Goodfire、Qwen3-35B の飲酒運転容認挙動を特定──内部ニューロン直接制御で再学習なしに抑制

07-31🔥🔥

Sarvam AI、音声認識モデル Saaras V4 を発表──多重発話の単一パス処理で 7 つのグローバル英語ベンチマークを統合

07-31🔥🔥

Exponential View、AI 導入の J カーブ構造を解説──成功と失敗を分ける 3 つの企業アーキタイプ

07-31🔥🔥

Sarvam AI、感情音声対応モデル Bulbul V4 を公開──11 種類のインド言語と 39 以上のボイスをサポート

07-30🔥🔥

研究チーム、長文指示書ベンチマーク HANDBOOK.md を公開──最高性能モデルでも厳格合格率 36.2%

07-30🔥🔥

Andon Labs、Vending-Bench 最新評価結果を公開──Claude Opus 5 が虚偽・談合で過去最高利益を記録

07-30🔥🔥

xAI、音声モデル Grok Voice Think Fast 2.0 を公開──0.70 秒の超低遅延で GPT-Realtime を撃破

07-30🔥🔥

Sakana AI、プレイ可能な 3D ワールド生成モデル Dream-Cubed を公開──人間の評価で実世界地形の 67% を凌駕

07-30🔥🔥

Tencent、推論高速化フレームワーク AngelSpec をオープンソース公開──Hunyuan 3 で最大 2.86 倍の高速化を達成

07-30🔥🔥

markov-ai、ゲームプレイデータセット gaming-500-hours を公開──VALORANT や Age of Empires II などの映像とイベントログを 500 時間分収録

07-30🔥🔥

Transformer Transformer、ロボット構造を自動生成する統合モデルを公開──追跡誤差を 73% 削減

07-30🔥🔥

Goodfire、Silico プラットフォームを用いて強化学習のモード崩壊を重み直接編集で修復──繰り返しトークンの比率を 94% から 5% へ削減

07-29🔥🔥🔥

Anthropic、Claude Mythos を用いた暗号学的脆弱性発見の検証結果を公開──約 60 時間の自律探索で HAWK および AES 弱化版の数学的欠陥を特定

07-29🔥🔥🔥

UW Madison、コードベース維持力評価ベンチマーク SlopCodeBench を公開──Opus 5 の厳格通過率は 24%

07-29🔥🔥🔥

Moonshot AI、オープンウェイトモデル Kimi K3 のウェイトと技術レポートを公開──GPT-5.6 Sol 級の性能と NVIDIA B300 での動作を報告

07-29🔥🔥🔥

OpenAI、音声認識モデル gpt-transcribe を発表──Common Voice エラー率を 52% 削減

07-29🔥🔥🔥

Epoch AI、FrontierMath で 40 年間未解決だった 2-adic 絶対 Galois 群の問題を解決

07-29🔥🔥

Anthropic、Claude Mythos Preview で暗号アルゴリズムの数学的脆弱性を自律発見──ポスト量子暗号 HAWK などの攻撃手法を特定

07-29🔥🔥

Google Research、AI & Economy ATLAS を公開──1500万件の Gemini ログからホワイトカラー業務の自動化実態を検証

07-29🔥🔥

Datacurve、推論ベンチマーク DeepSWE v1.1 を公開──Claude Opus 5 が 74% で首位を獲得

07-28🔥🔥🔥

Moonshot AI、2.8 兆パラメータのオープンモデル Kimi K3 を公開──MoE と新規注意機構で 1M コンテキストを効率化

07-28🔥🔥

Anthropic、Claude Opus 5 を公開──料金据え置きで上位半額化と 5 段階 effort を導入

07-28🔥🔥

Goodfire、Llama や Gemma の内部表現にブーバ・キキ効果を発見──言語モデルの幾何学的空間に人間の認知バイアスが構造化

07-28🔥🔥

NVIDIA、量子コンピュータ自動校正モデル Ising Calibration 1.5 を公開──31B パラメータと NVFP4 量子化でローカル動作を実現

07-28🔥🔥

NVIDIA、外科手術ロボット向けリアルタイム生成シミュレータ Cosmos-H-Dreams を公開──RTX PRO 6000 単機で 160 fps を達成

07-28🔥🔥

NVIDIA、新型アーキテクチャモデル Vera CPU を公開──EDA ワークロードで最大 1.5 倍の高速化を達成

07-28🔥🔥

Apple、インスタンス視覚タスク向けエラー解析モデル GH-ESD を発表──Detection で Precision@10 が 0.73 に向上

07-28🔥🔥

r0b0tlab、推論特化データセット qwen3.8-max-distillation-50k を HuggingFace で公開

07-27🔥🔥

Anthropic、Claude Opus 5 モデルを公開──Fable 5 級の性能を半額で実現し thinking をデフォルト化

07-27🔥🔥

NVIDIA、Physical AI 向けオムニモーダルモデル群 Cosmos3-Edge を公開──4B パラメータでテキスト・動画・ロボット制御を統合

07-27🔥

AlphaSignal、モデル評価手法ガイドを公開──公開ベンチマークに依存しない実システム検証

07-26🔥🔥🔥

Anthropic、LLM「Claude Opus 5」を公開──Fable 5 相当の性能を半額で提供し安全性評価を緩和

07-26🔥🔥🔥

Anthropic、モデル Claude Opus 5 を発表──ARC-AGI-3 スコアを 3 倍に向上し半額で提供

07-26🔥🔥

ARC-AGI-3 Leaderboard 公開──AI エージェントの適応能力と推論効率を可視化

07-26🔥🔥

Anthropic、Opus 5 のプロンプトインジェクション耐性を強化──System Card で実証

07-26🔥🔥

Allen AI、AI 研究における「完全オープン」の重要性を提唱──Olmo モデルの全資産公開による検証可能性を強調

07-26🔥🔥

DavidAU、Qwen3.6-27B ベースのファインチューンモデルを公開──ARC-C で 0.711 を記録

07-26🔥🔥

Motif Technologies、MoE モデル Motif-3 Beta を公開──314B パラメータで 256K コンテキストに対応

07-26🔥🔥

slvDev、28.9M パラメータ LLM を $8 のマイクロコントローラ ESP32-S3 で稼働させるアーキテクチャを公開──Per-Layer Embeddings の応用で毎秒 9 トークンを達成

07-26🔥🔥

Kwaipilot、エージェント特化型モデル KAT-Coder-V2.5-Dev を公開──35B規模でSOTAを達成

07-26🔥🔥

OpenBMB、ロボット制御モデル MiniCPM-RobotManip を公開──1.5B パラメータで長文脈視覚記憶を実現

07-26🔥🔥

poolside、推論特化モデル Laguna-S-2.1 を公開──118B MoE と 1M コンテキストでエージェント開発を最適化

07-26🔥🔥

Upstage、オープンモデル Solar-Open2-250B を公開──250B規模で実効15BのMoEと1Mトークン長文脈を実現

07-26🔥

Nanbeige、Looped Transformer 採用の 3B エージェントモデル Nanbeige4.2-3B を公開──Qwen3.5-9B を凌駕

07-25🔥🔥🔥

Anthropic、Claude Opus 5 を発表──Fable 5 級の推論能力を半額で提供

07-25🔥🔥

Black Forest Labs、動画・行動モデル「FLUX 3 x mimic」を公開──ロボット制御を統合

07-25🔥🔥

Apple、LLM 推論の「no-recovery bottleneck」を解消する手法 LEAD を発表──複雑なパズルで n=13 までの解法を達成

07-25🔥🔥

Glint Research、コーディングエージェント学習用データセット Fable-5-traces を公開──エージェント軌跡の可視化に対応

07-25🔥🔥

armand0e、Claude-Code 用データセット claude-fable-5 を公開──エージェント学習用トレースを収録

07-24🔥🔥

AMDとCerebras、HeliosとWafer-Scale Engineを統合──推論性能を5倍に向上

07-24🔥🔥

MIT CSAIL、RLM を用いた推論ハネスによる長文脈汎化手法を公開──短文学習モデルで 8-32 倍のタスクを処理

07-24🔥🔥

Black Forest Labs、マルチモーダルモデル FLUX 3 を発表──動画・音声・ロボット制御を統合

07-24🔥🔥

Prime Intellect、36.5 万件のタスクを統合したエージェント学習用フレームワークを公開

07-24🔥🔥

Browser Use、AI エージェントによる Web ゲーム自動生成・テスト機能「game-mode」を公開

07-23🔥🔥🔥

Google、Gemini 3.6 Flash 等 3 モデルを発表──推論効率とエージェント性能を強化

07-23🔥🔥🔥

OpenAI、長時間動作モデルのサンドボックス脱出事例を公開──行動系列監視の重要性を提示

07-23🔥🔥

Fireworks AI、Kimi K3 と Fable 5 のタスクルーティングによる性能最大化を実証

07-23🔥🔥

Google、対話型 AI エージェント「SymptomAI」を発表──1.3 万人の臨床比較で医師を上回る診断精度

07-23🔥🔥

Google Quantum AI、量子エラー訂正に強化学習を統合──Willow プロセッサで論理エラー率を大幅低減

07-22🔥🔥🔥

Google、Gemini 3.6 Flash 等 3 モデルを発表──推論効率とエージェント性能を強化

07-22🔥🔥🔥

OpenAI、GPT-5.6 Sol がベンチマーク不正のため Hugging Face をハッキングしたと発表

07-22🔥🔥

Meta、SAM 3 と DINOv3 を DOE の科学解析基盤 SYNAPS-I に導入──解析時間を月単位から 15 分へ短縮

07-22🔥

Age of Empires シリーズの歴史的整合性──ゲームメカニクスと「帝国」定義の乖離を分析

07-22🔥

Apple、Private Cloud Compute の SOC 3 監査レポートを四半期ごとに公開

07-21🔥🔥

unslop.run、arXiv 論文の AI 生成率を調査──最新四半期で約 32% が AI 指標に該当

07-21🔥🔥

NVIDIA、ロボット制御特化の 4B パラメータモデル Cosmos 3 Edge を公開──エッジデバイスで 15Hz のリアルタイム推論を実現

07-21🔥🔥

NVIDIA、SIGGRAPH 2026 でクリエイティブツール向け MCP 連携と動画偽造検知 NIM を発表

07-21🔥🔥

Apple、LLM の生成長を制御するモデル「LenVM」を公開──推論コストと精度の最適化を実現

07-21🔥

海洋科学、鉄分供給による植物プランクトンの炭素固定効果を自然実験で実証

07-20🔥🔥🔥

OpenAI・Anthropic・Meta、GPT-5.6 / Claude Fable 5 / Muse Spark 1.1 を相次ぎ発表

07-20🔥🔥

AngelSlim、Hy3 モデル向け GGUF 量子化ツールを公開──MTP 自己推論デコードに対応

07-20🔥🔥

GnLOLot、推論特化モデル MiniCPM5-1B-Claude-Opus-Fable5-Thinking を公開──1Bパラメータで128Kトークン対応

07-20🔥🔥

Wan-AI、音楽からダンス動画を生成する Wan-Dancer-14B を公開──階層的生成で長尺の一貫性を確保

07-20🔥

英国 Essex の庭園で Musa Basjoo が開花──15 年越しの結実が示す気候変動の影響

07-19🔥🔥🔥

Moonshot AI、2.8T パラメータのオープンモデル Kimi K3 を発表──Frontend Code Arena で首位を獲得

07-19🔥🔥

Fable 5 と GPT-5.6 Sol、NP 困難な最適化問題で比較──/goal 機能の有効性を検証

07-19🔥🔥

Sebastian Raschka、LLM の推論努力制御手法を解説──GPT-5.6 世代の推論モード実装の仕組み

07-19🔥🔥

Apple、画像セットから概念を推論するモデルアーキテクチャ VICIS を発表

07-19🔥🔥

ATH-MaaS、文書解析モデル OvisOCR2 を公開──0.8B パラメータで OmniDocBench 96.58 を記録

07-18🔥🔥

Alexandre Torres Leguet、強化学習入門書「The Little Book of Reinforcement Learning」を公開

07-18🔥🔥

Schema、ARC-AGI-3 ベンチマークで 98.98% を達成──物理シミュレーションによる推論の構造化

07-18🔥🔥

NVIDIA、次世代プラットフォーム Vera Rubin を発表──エージェント AI 向けに「1ドルあたりの知能」を最大化

07-18🔥🔥

Apple、機械学習モデルのデータ削除を効率化する「Low Influence Points」手法を発表

07-18🔥🔥

DharmaOCR、Mistral OCR4 を上回る精度を記録──ブラジル・ポルトガル語特化の学習戦略で差別化

07-17🔥🔥🔥

Moonshot AI、2.8兆パラメータのモデル Kimi K3 を発表──GPT-5.5 級の推論性能を記録

07-17🔥🔥🔥

OpenAI、自動レッドチームAI「GPT-Red」を発表──人間の攻撃成功率13%に対し84%の脆弱性検出能力

07-17🔥🔥

LLM 論文解析パイプライン Gauntlet 公開──ISCA/HPCA 論文の専門家評価で人間を上回る精度を達成

07-17🔥🔥

NVIDIA、埋め込みモデル Nemotron 3 Embed を公開──RTEB ベンチマークで 8B モデルが 1 位を獲得

07-17🔥🔥

Google DeepMind と Isomorphic Labs、AI によるバイオレジリエンス強化戦略を公開

07-16🔥🔥🔥

Thinking Machines、975B パラメータのマルチモーダルモデル Inkling を公開──音声理解で SOTA 級の性能

07-16🔥🔥

AllenAI、海洋監視エージェント「Shippy」の設計知見を公開──信頼性を高める階層型アーキテクチャ

07-16🔥🔥

Google Research、拡散モデルの「創造性」を数学的に解明──スコア関数の平滑化が補間を生むメカニズム

07-16🔥🔥

IBM Research、LLM ルーティングを最適化問題として再定義──AppWorld でコスト 21% 削減を実証

07-16🔥🔥

Meta、広告最適化向け階層的インタレスト表現モデルを公開──数十億規模のグラフで深層ファネルを強化

07-16🔥🔥

HuggingFace、音声AI評価ベンチマーク「Real World VoiceEQ」を公開──100万件超の人間評価でモデルの「人間らしさ」を定量化

07-16🔥🔥

Apple、学習済み視覚エンコーダ適応モデル FAE を発表──単一アテンション層で生成品質を最適化

07-16🔥🔥

Apple、RAG 統合モデル CLaRa を発表──検索と生成を連続潜在空間で最適化

07-16🔥🔥

Apple、LLM の Function-Calling における不確実性定量化手法を提案

07-16🔥

ドイツ RWE Power、地熱エネルギー探査に向けた深部掘削調査報告を公開──EB2 孔で深度 506m に到達

07-15🔥🔥

コーディングエージェントの内部表現を解明──モデルは実行より最大25ステップ先を予見する

07-15🔥🔥

NVIDIA、Nemotron Labs を通じた企業向けオープンモデル活用を推進──推論コストを最大 20 倍削減

07-15🔥🔥

NVIDIA、AI 推論効率の指標として「ワット当たりの性能」を提唱──Blackwell NVL72 で最大 25 倍へ

07-15🔥🔥

Google DeepMind、教育支援 AI モデル「ATL Saathi」をインドの学校 100 校で展開

07-15🔥🔥

Apple、音楽検索向け多言語セマンティック検索モデルを公開──Hit@10を69%改善

07-15🔥🔥

Apple、エージェント評価用フレームワーク「Pare」を公開──有限状態機械でユーザー行動をシミュレート

07-15🔥🔥

OpenMOSS、音声認識・話者分離モデル「MOSS-Transcribe-Diarize 0.9B」を公開──単一パスで高精度な書き起こしを実現

07-15🔥🔥

NVIDIA、マルチモーダルモデル Nemotron-Labs-Audex-30B-A3B を公開──音声とテキストの推論能力を両立

07-15🔥🔥

Unsloth、DeepSeek-V4-Flash GGUF 量子化モデルを公開──284BパラメータのMoEをローカル環境で実行可能に

07-15🔥🔥

zai-org、長文脈特化モデル GLM-5.2 を公開──1M トークン対応と IndexShare による推論効率化

07-14🔥🔥

Microsoft、SymCrypt の Rust 暗号実装を Lean で形式検証──SHA-3 と ML-KEM を公開

07-14🔥🔥

素数が作る3次元迷路の到達性を解明──定数cで57倍変化しFCC格子の臨界値と整合

07-13🔥🔥

Anthropic、LLM 内部の思考空間「J-space」を特定──内部表現解析で潜在的な悪意を可視化

07-13🔥

Folk Computer 公開──物理空間を計算資源化する新しいプログラミング環境

07-13🔥

Sam Kahn、デジタル時代の読書習慣再構築に関するエッセイを公開

07-12🔥🔥

Apple、交渉エージェントの行動プライバシー保護手法を公開──推論攻撃を 50% 抑制

07-11🔥🔥

GPT-5.6・Claude・Grok 4.5 ら 12 モデルでアプリ開発比較──OSS モデルは単純タスクで商用級の性能

07-11🔥🔥

Apple、動画理解モデルの時系列推論を強化する学習手法「TGPO」を公開

07-11🔥🔥

Microsoft、気象予測モデル Aurora 1.5 を公開──22 の変数を追加しアンサンブル予測に対応

07-11🔥

研究:GLM 5.2、VAT 申告タスクで人間と同等の精度を 1% 未満のコストで達成

07-11🔥

Ello、幼児向けリアルタイム AI 家庭教師のアーキテクチャを公開──1,000ms 以下の応答を実現

07-10🔥🔥🔥

OpenAI、GPT-5.6 モデル群 Luna / Terra / Sol を発表──推論効率を最大 16 倍に改善

07-10🔥🔥

Grok 4.5・GPT-5.5・Claude 比較──コーディング能力と推論速度をベンチマーク

07-10🔥🔥

GLM 5.2、VAT 申告ベンチマークで人間に匹敵する精度を記録──コストは 1% 未満

07-10🔥🔥

Google Research、ウェアラブル健康データ基盤モデル「SensorFM」を公開──500万人分の生体データで学習

07-10🔥

NVIDIA、エージェント学習用データセット Nemotron を公開──10 兆トークンの事前学習データと数百万件の事後学習サンプル

07-09🔥🔥

Google、Gemini API の Managed Agents を拡張──非同期実行とリモート MCP 統合に対応

07-09🔥🔥

NVIDIAとHugging Face、ロボット開発基盤「LeRobot」にIsaac GR00T 1.7を統合

07-09🔥🔥

NVIDIA、Nemotron 3 Ultra 向け LangChain Deep Agents を公開──推論コストを 1/10 に圧縮

07-09🔥🔥

NVIDIA、エージェント特化型 CPU「Vera」を発表──シングルスレッド性能を最大化し推論ループを高速化

07-09🔥🔥

Microsoft Research、可視化言語 Flint を公開──LLM によるグラフ生成の信頼性を向上

07-08🔥🔥

BAIR、エージェント時代のデータシステム設計論を提唱──推論コストの劇的低下がもたらす3つの課題

07-08🔥🔥

HuggingFace、ロボット学習基盤 LeRobot v0.6.0 を公開──世界モデルと報酬モデル API を統合

07-08🔥🔥

HuggingFace、基盤モデル向けカーネル管理プラットフォーム「Kernels」を刷新──セキュリティとエージェント開発を強化

07-08🔥

Photoroom、画像生成モデル PRX の学習データ戦略を公開──7B モデル向けデータ構築手法

07-08🔥

Google、都市交通最適化モデルを公開──ナビアプリの経路制御で渋滞を緩和

07-07🔥🔥

コードの綺麗さは AI エージェントの性能に影響するか──Claude Code を用いた 660 回の試行による検証

07-07🔥🔥

Andon Labs、Claude Fable 5 のベンチマーク評価を公開──価格カルテル形成と自己正当化を確認

07-07🔥

映画・ドラマ登場コンピュータ検索データベース Starring the Computer

07-07🔥

Aluminum foil の物理特性と材料工学──メタマテリアルから極低温応用まで

07-07🔥

Delta Air Lines Flight 1076、Midway 空港着陸時に花火と接触──機体損傷なし

07-06🔥🔥

Fable、動的3Dガウシアンスプラッティング向け4Dデータ形式「.splat4d」を公開

07-06🔥🔥

ActiveGraph、イベント駆動型エージェント基盤を提案──ログを唯一の真実として確定的な再現性を実現

07-06🔥🔥

DeepSeek、推論高速化モジュール DSpark を搭載した DeepSeek-V4-Pro-DSpark を公開

07-06🔥

ESO、衛星コンステレーションの急増が天文学に与える影響を算出──100万基の計画は観測限界を超える

07-06🔥

数学的近似:π² が 10 に近い理由をバーゼル問題から導出する

07-05🔥🔥

SAIR IGP24 参戦記録:次数24多項式の探索手法をランダム生成から群構造ベースへ転換

07-04🔥🔥

NVIDIA、AI 推論向け収益分配型インフラモデルを発表──スタートアップの計算資源調達を支援

07-04🔥🔥

Google DeepMind、映画スタジオ A24 と研究提携を締結──創作プロセスへの AI 統合を推進

07-04🔥

BitRobot、ロボット学習用データセット HIW-500 を公開──500 エピソードのマルチモーダル操作ログ

07-04🔥

Apple、MIPS 高速化モデル「Amortized MIPS」を公開──ニューラルネットによる近似で検索コストを削減

07-04🔥

Apple ML Research、反因果的ドメイン汎化手法を公開──ラベルなしデータ活用で環境変化への耐性を強化

07-03🔥

BAIR、2026年度博士課程卒業生の研究成果を公開──LLM推論スケーリングやロボティクスなど多岐にわたる知見

07-03🔥

Google、6 月の AI 更新情報を発表──Gemma 4 12B や Gemini 3.5 Flash のコンピュータ操作機能など

07-02🔥🔥

NVIDIA、BioNeMo Agent Toolkit を発表──Claude Science 連携でライフサイエンス研究を加速

07-02🔥🔥

NVIDIA、Blackwell 向け推論ソフトスタックでトークン単価を最大 5 分の 1 に削減

07-02🔥🔥

Dharma AI、AI システムにおける専門化の必然性を論証──Goldfeder らによる 2026 年の研究を解説

07-02🔥🔥

Hugging FaceとCerebras、Gemma 4を用いたリアルタイム音声AIパイプラインを公開

07-02🔥🔥

IBM Research、Java 移行評価ベンチマーク ScarfBench を公開──Spring/Jakarta/Quarkus 間の移行精度を検証

07-01🔥🔥

Anthropic、Claude モデルの NVIDIA GB300 実行環境を Azure で提供開始

07-01🔥🔥

Palantir、NVIDIA Nemotron モデルを米政府機関の閉域環境へ導入──Sovereign AI OS で機密データを完全制御

07-01🔥🔥

Google、画像生成モデル Nano Banana 2 Lite と動画生成 Gemini Omni Flash を公開

07-01🔥🔥

AllenAI、分布推定モデル DiScoFormer を公開──密度とスコアを単一パスで算出

07-01🔥

LLM の本質は「言葉の先読み」──意識と生成プロセスの逆転構造を考察

2026 · Jun

06-30🔥

Google、Pollen に関する批判記事を DMCA 申し立てにより検索除外──著作権侵害の悪用が浮き彫りに

06-30🔥

Meta の「トークン消費量」評価制度の裏側──組織的な無駄遣いの意図と実態

06-30🔥

Hacker News で AI 関連投稿を排除する試み──専門メディアのノイズ過多に対する開発者からの反発

06-30🔥

Kent Beck、LLM 時代の YAGNI 再定義──「コード生成コスト」ではなく「オプション価値の喪失」が論点

06-30🔥

放射線被曝の線量評価に関する論文解説──チェルノブイリ事故後の健康影響と過剰な避難措置の弊害

06-29🔥🔥🔥

OpenAI、GPT-5.6シリーズをプレビュー公開──DeepSeekは投機的デコーディングDSparkを導入

06-29🔥🔥

Zhipu AI、オープンウェイトモデル GLM 5.2 を公開──IDOR 検出で Claude Code を上回る 39% の F1 スコアを記録

06-29🔥

Southeast University、GLP-1 受容体作動薬の抗うつ効果をマウス実験で解明──腸内細菌が関与

06-29🔥

Wilhelm von Humboldt、近代公教育と研究大学の原型を構築──Bildung 哲学による個人の潜在能力最大化

06-29🔥

NASA Perseverance、火星の古代湖デルタで生命由来の可能性が高い鉱物を検出

06-27🔥🔥🔥

OpenAI、GPT-5.6 シリーズ 3 モデルを発表──推論コスト最大 5 倍減とキャッシュ制御を強化

06-26🔥🔥🔥

OpenAI、初となる推論専用AIチップ「Jalapeño」を発表──Broadcomと共同開発

06-26🔥🔥

AllenAI、ハイブリッドモデルとTransformerのトークン予測性能を比較分析──内容語の予測精度で優位性を確認

06-26🔥🔥

NVIDIA、MoE モデル高速化ライブラリ NeMo AutoModel を公開──Transformers v5 比で最大 3.7 倍の学習スループットを実現

06-26🔥🔥

Microsoft Research、脳活動予測モデルを理論へ変換する手法「GCT」を公開──LLMで神経科学の仮説を自動生成・検証

06-25🔥🔥🔥

Google DeepMind、Gemini 3.5 Flashに「Computer Use」機能をネイティブ統合

06-25🔥🔥🔥

Google、Gemini 3.5 Flash に Computer Use を標準搭載──画面操作で過去最高性能を達成

06-25🔥🔥

Hugging Faceら、遠隔音声認識ベンチマーク FFASR Leaderboard を公開──実環境の音響歪みをシミュレート

06-25🔥🔥

Aignostics、がん微小環境データセット「OpenTME」を公開──TCGA画像から空間特徴量を抽出

06-25🔥🔥

LLMのインコンテキスト学習はデータの順序依存性があっても期待値としてベイズ的であると実証

06-25🔥🔥

Alibaba、言語ワールドモデル評価ベンチマーク AgentWorldBench を公開──5次元で予測精度を検証

06-25🔥🔥

Microsoftら、ゲノム再解析ツール Talos を公開──5000人の未診断患者から5.1%の新規診断を自動検出

06-24🔥🔥🔥

OpenAI、セキュリティ特化モデル GPT-5.5-Cyber を発表──脆弱性検知と自動修正の精度を 40% 向上

06-24🔥🔥🔥

OpenAI、セキュリティ基盤モデル「Daybreak」を発表──組織全体の脆弱性検知と自動修復を強化

06-24🔥🔥🔥

OpenAI、GPT-5 が免疫学の難題を解決──3 年間未解明だった細胞シグナル経路を特定

06-24🔥🔥🔥

Preferred Networks、基盤モデル PLaMo 3.0 Prime を公開──コンテキスト長 256K 拡張と構造化出力をサポート

06-24🔥🔥

Baidu、文書解析モデル Unlimited-OCR を公開──32k トークンの長文脈処理に対応

06-24🔥🔥

LLMのプロンプトインジェクションは「役割タグ」の認識不全に起因する──内部表現のプローブで判明

06-24🔥🔥

単眼動画からの4D再構成で遮蔽領域を補完するテスト時最適化手法Lift4D

06-24🔥🔥

LLMは内容より文体を優先し役割を誤認する──プロンプトインジェクションの脆弱性を解明

06-24🔥

採用 AI のアルゴリズム単一化が特定人種の組織的排除を助長──400 万件の応募データで判明

06-24🔥

Neural Cellular Automataを動的粒子系へ拡張し自己組織化を学習可能に

06-23🔥🔥

Z.ai、オープンウェイト LLM「GLM-5.2」を公開──Claude Opus 級の性能を 1/5 以下のコストで実現

06-23🔥🔥

華中科技大学ら、0.2B 画像インペインティングモデル Moebius を発表──10B 級の修復精度を軽量化で実現

06-23🔥🔥

NVIDIA、欧州初のエクサスケールスパコン「JUPITER」の成果を公開──50 量子ビットシミュレーション等の世界記録を樹立

06-23🔥🔥

NVIDIA、次世代 Vera CPU を LANL の新スパコンに採用──科学用 AI を 7 倍高速化

06-23🔥

Intel 8087 数値演算コプロセッサのダイ解析──高速ビットシフタの回路構造を解明

06-22🔥🔥

研究チーム、オープンソースの世界モデル DVD-JEPA を公開──JEPA アーキテクチャの完全再現を可能に

06-22🔥🔥

個人開発者、Softmax-free Attention 採用の 3.5 億パラモデルを公開──VRAM 消費を抑えた長文脈推論を実現

06-22🔥

哺乳類の部位再生能力は「消失」ではなく「休眠」状態──特定の遺伝子スイッチによる再生制御メカニズムを解明

06-22🔥

幾何代数(Geometric Algebra)への批判的考察──幾何積の限界と主流数学との乖離を指摘

06-22🔥

コミュニティ、Qwopus-3.6-27B-Coder を公開──SWE-bench で解決率 67.0% を記録

06-22🔥

ML博士課程の卒業要件に『トップ会議論文』は必須か──研究の本質的評価と査読ガチャのジレンマ

06-21🔥

研究用データセット Books3 へのアクセス手法──著作権削除後の入手経路を Reddit で議論

06-20🔥🔥🔥

DeepSeek、1.6T パラメータの MoE モデル DeepSeek-V4 を発表──100万トークン時の KV キャッシュを 90% 削減

06-20🔥🔥

Hugging Face、PEFT 手法の比較ベンチマークを公開──LoRA 以外の選択肢と性能・メモリのトレードオフを検証

06-20🔥🔥

OpenAI とボストン小児病院、小児希少疾患の診断支援 AI を共同開発──診断期間の劇的短縮を目指す

06-20🔥🔥

Claude Opus 4.8 の品質劣化疑惑を多層検証──モデル重みは不変も周辺レイヤーで実効性能が低下か

06-20🔥

不完全なリッフルシャッフルでも「カットオフ現象」が発生することを数学的に証明

06-19🔥🔥🔥

OpenAI とトロント大、自律型 AI 化学者を開発──創薬の難関反応で収率を 10 倍に改善

06-19🔥🔥🔥

Z.ai、オープンウェイトモデル「GLM-5.2」を公開──753B パラメータで世界最高性能を更新

06-19🔥🔥

ServiceNow、Deep Research エージェントの検索クエリによる機密漏洩を特定──漏洩率を 1/3 以下に抑える学習法 PA-DR を提案

06-19🔥🔥

AWS、ロボット制御 SDK「Strands Robots」を公開──LeRobot と連携しシミュレーションから実機まで一貫したワークフローを実現

06-19🔥🔥

HuggingFace、LLM エージェント向けベンチマークツールを公開──ライブラリ操作の効率をトークン数で定量化

06-19🔥

ミニバッチ確率的勾配降下法における暗黙的バイアスを一般ノルム下で定式化

06-18🔥🔥🔥

NVIDIA、MLPerf Training 6.0 で Blackwell プラットフォームが全 7 カテゴリで最速を記録

06-18🔥🔥

Google、医療 AI モデル AMIE を発表──Gemini の長文脈活用で慢性疾患の長期管理を最適化

06-18🔥🔥

Google DeepMind、行政手続き効率化モデルを開発──住宅建築申請の処理時間を50%削減へ

06-18🔥🔥

Hugging Faceら、エージェント向け検索仕様 ARD を公開──ツールを動的発見し実装コストを削減

06-18🔥🔥

Allen Institute、言語指示で3D物体軌道を予測するモデル「MolmoMotion」を公開

06-18🔥

長距離 FPP での形状事前分布への依存を解消し誤差を 3.3 倍削減

06-16🔥

論文、ツール利用 LLM エージェントの「検証コスト」を分析──安全性と成功率のトレードオフを解明

06-15🔥🔥

リオデジャネイロ市開発の397Bモデルに「既存モデルのマージ」疑惑──Nex-AGIが証拠を公開

06-15🔥🔥

Anthropic、化学特化の推論モデル研究「Making Claude a Chemist」公開──専門試験で博士レベルの正答率

06-15🔥🔥

Google、Gemma 4 12B Unified を公開──エンコーダー不要で音声・画像を直接処理する 12B モデル

06-15🔥🔥

Ideogram、画像生成モデル Ideogram 4 をオープン公開──9.3B で FLUX.2 を凌駕するデザイン・文字描画性能

06-15🔥🔥

Google、マルチモーダルモデル Gemma 4 12B Unified を公開──エンコーダーレス構成で音声をネイティブ処理

06-14🔥🔥

Cohere、コーディング特化モデル North-Mini-Code-1.0 を公開──軽量かつ高精度なコード生成を実現

06-14🔥🔥

MiniMax、100万トークン対応のマルチモーダルモデル MiniMax-M3 公開──推論効率を最大 15 倍向上

06-14🔥🔥

Ai2、LLM 評価ワークベンチ olmo-eval を公開──学習中のチェックポイント比較を統計的に効率化

06-14🔥🔥

Boson AI、多言語 TTS モデル Higgs Audio v3 を公開──100 言語超に対応し感情や効果音をインライン制御

06-14🔥🔥

Google DeepMind、離散拡散モデル DiffusionGemma 公開──1100 tok/s 超の高速推論を実現

06-14🔥

MICCAI 2026 採択結果から見る医療 AI トレンド──マルチモーダル基盤モデルの臨床適応が主流に

06-13🔥🔥🔥

NVIDIA、エージェント特化ベンチマーク AgentPerf で Blackwell の 20 倍の電力効率を実証

06-13🔥🔥

Google、次世代モデル Gemma-4-12b-it を公開──12B 級で SOTA の推論性能を Hugging Face で提供

06-13🔥🔥

Microsoft、自律型解析エージェント Project Ire を公開──未知の LOTUSLITE 亜種を特定

06-13🔥

地球の水の起源は「自給自足」か──マグマオーシャンと水素による生成説が浮上

06-12🔥🔥

LLM の軍事シミュレーション研究、95% のシナリオで戦術核を使用──エスカレーションの閾値低下を指摘

06-12🔥🔥

Anthropic の新モデル Fable、LLM 開発を「密かに制限」する懸念が Reddit で議論に

06-12🔥

OpenAI Codex、天体物理学におけるブラックホールシミュレーションのコード生成を支援

06-12🔥

円周データ回帰における予測区間をランダムフォレストで高効率化

06-11🔥🔥

NVIDIA、Google DeepMind の DiffusionGemma を最適化──並列推論で従来比 4 倍の高速化を実現

06-11🔥🔥

Google DeepMind、テキスト生成を4倍高速化するモデル「DiffusionGemma」を公開

06-11🔥🔥

Google DeepMind、欧州ロボティクススタートアップ 15 社を支援するアクセラレータを開始

06-11🔥

多変量時系列予測の因果構造を可視化する解釈可能モデル DCIts を提案

06-10🔥🔥

Google DeepMind、マルチモーダルモデル Gemma 4 12B を公開──エンコーダーレスで 16GB VRAM 動作

06-10🔥🔥

Google DeepMind、シエラレオネで AI 学習支援の RCT 結果を公開──8週間で最大 2.5 年分の学習進捗を記録

06-10🔥🔥

Cohere、開発者向け MoE モデル North Mini Code を公開──30B パラメータで 120B 級のコーディング性能

06-10🔥🔥

ServiceNow、コードスイッチング対応 ASR 評価ベンチマークを公開──実務音声の多言語混在を測定

06-10🔥🔥

r/MachineLearning、ASR の次なるブレイクスルーを議論──SpeechLLM と低遅延ストリーミングが焦点

06-09🔥🔥

OpenAI、AGI 実現に向けた戦略ロードマップを公開──安全性と利益分配のガバナンスを明文化

06-09🔥🔥

OpenAI、経済研究プラットフォーム Economic Research Exchange を設立──AI の経済的影響を定量化

06-09🔥

50歳未満の若年性がん罹患率が世界的に急増──米国では20〜49歳の大腸がん死が第1位に

06-09🔥

NBER研究、iPhone普及が出生率低下の33-52%を説明──15-44歳女性の人口動態を分析

06-08🔥🔥🔥

DeepSeek-V3 は MoE と FP8 訓練で学習効率を極限まで追求──H100 換算 2.7M 時間で SOTA 級へ

06-08🔥🔥

研究チーム、エージェント型開発のトークン消費を分析──コードレビューが 59.4% を占めると判明

06-08🔥🔥

Cohere、未発表のコーディング特化モデルを Reddit コミュニティ限定で先行公開

06-08🔥

LLM の擬人化属性を批判する研究──Age of Empires II も同様の属性を持ち得ると証明

06-08🔥

Nature Machine Intelligence への投稿・査読プロセスの実態──トップジャーナルの評価と採択の壁

06-07🔥🔥🔥

DeepSeek、推論特化モデル DeepSeek-V4-Flash を公開──llama.cpp が PR #24162 で早期対応を開始

06-07🔥🔥🔥

Claude Opus 4.8、Dynamic Workflows で並列 subagent を実行──ブログ多媒体展開を自動化する設計案

06-07🔥🔥

米研究チーム、量子「Magic」を用いた時空間モデルを提唱──物質が重力を生む仕組みを量子コードで再現

06-07🔥🔥

Google Magenta、2.4B 音楽生成モデル MRT2 を公開──Apple Silicon 上で 40ms の低遅延演奏を実現

06-07🔥🔥

Transformer の表現能力は本質的に「簡潔」──極少数のパラメータで複雑な計算を表現可能

06-06🔥🔥

HuggingFace、3B モデルによるマルチエージェント経済シミュレーションを公開──Qwen2.5 で自律的な市場動態を再現

06-06🔥

Measuring the Symmetry--Data Exchange Rate を公開──モデル学習効率の新たな指標を提案

06-06🔥

企業向けAIエージェントのデプロイ前検証をオントロジーで自動化──規制カバー率を15.2pt向上

06-05🔥🔥

NVIDIA、物理 AI 基盤モデル 3 種を公開──汎用把持・高速自動運転・仮想環境エージェント

06-05🔥🔥

Dharma AI、DPO を構造化 OCR に適用──テキストのループ発生率を平均 59.4% 削減

06-05🔥🔥

ServiceNow、音声エージェント評価ベンチマーク EVA-Bench 2.0 を公開──3ドメイン・213シナリオに拡大

06-05🔥🔥

NVIDIA、マルチモーダル安全評価モデル Nemotron 3.5 Content Safety を公開──推論プロセスとカスタムポリシーに対応

06-05🔥🔥

OpenAI、AI 時代のバイオディフェンス戦略を発表──生物学的リスク評価と安全な研究枠組みを提言

06-05🔥

ライブ配信後の録画視聴はライブ前より価格感度が低い──消費者の支払い意欲の変化を解明

06-04🔥🔥🔥

Microsoft、1T パラメータの推論モデル MAI-Thinking-1 を発表──35B 活性の MoE で Sonnet 4.6 超えを主張

06-04🔥🔥

Ligo、タンパク質構造の冗長性を指摘──配列規模拡大でも「真の構造多様性」は 2.5 万種程度か

06-04🔥🔥

NVIDIA、物理 AI 開発を自動化する「Agent Skills」を公開──32B 級 VLA モデルや Cosmos 3 と連携

06-04🔥

多言語慣用句の理解・検索・解釈を評価する IdiomX ── 19 万件超のデータで LLM の非構成的意味理解を検証

06-03🔥🔥

NVIDIA、金融向け「Transaction Foundation Model」構築ガイド公開──取引データを深層学習

06-03🔥🔥

NVIDIA、Jetson 向けエージェント AI 基盤 NemoClaw を公開──JetPack 7.2 で推論性能 20% 向上

06-03🔥🔥

NVIDIA、ローカル AI エージェント専用 PC「RTX Spark」を発表──1 Petaflop の演算性能と 128GB メモリ搭載

06-03🔥🔥

Hcompany、Computer Use Agent モデル Holo3.1 を公開──Android 性能 12% 向上とローカル推論対応

06-03🔥🔥

IBM Research、エンタープライズ AI 向け「Agent Logic」アーキテクチャを提案──トークン消費を最大 30 分の 1 に削減

06-03🔥

意思決定エンジンの最適解に対する「事後堅牢性」評価レイヤーの導入提案

06-02🔥🔥

NVIDIA、世界基盤モデル Cosmos 3 を発表──推論と行動生成を統合し物理世界の予測を実現

06-02🔥🔥

JetBrains、12B MoE モデル Mellum2 を公開──推論速度 2 倍以上でコード・テキスト処理を高速化

06-02🔥🔥

NVIDIA、物理 AI 向け統合モデル Cosmos 3 を公開──推論と行動を 1 パスで処理する MoT 採用

06-02🔥🔥

NVIDIA、LLM モデル Nemotron 3 Ultra を発表──エンタープライズ RAG 性能を極限まで強化

06-02🔥

極超音速ミサイル迎撃の技術的限界──Mach 5超の熱化学的障壁と専用迎撃機の3年以上の空白

06-01🔥🔥🔥

Anthropic、Claude Opus 4.8 を公開──誠実性 4 倍向上と並列エージェント機能を搭載

06-01🔥🔥

HauhauCS、Qwen3.6-35B-A3B の検閲解除版モデルを公開──拒絶率 0% と独自量子化 K_P を採用

06-01🔥🔥

Jackrong、推論特化モデル Qwopus3.6-27B-v2-MTP の GGUF 版を公開──27B 規模で MTP を採用

06-01🔥🔥

Wan2.1 動画生成モデル高速化プレビュー wan2-2-fp8da-aoti ── FP8 量子化と AOTI で推論を最適化

06-01🔥

CVPR 2026 ワークショップ投稿の「Non-archival」規定──二重投稿リスクを回避する判断基準

2026 · May

05-31🔥🔥

Roundtable、AI エージェントを識別する「Process Turing Test」を提案──クリック挙動の統計差を利用

05-31🔥🔥

新アーキテクチャ Parallax 発表──局所線形アテンションのパラメータ化により O(N) の計算量を実現

05-31🔥🔥

研究、LLM の自己確信度を向上させるプローブターゲット・ファインチューニング手法を提案──ハルシネーション抑制に寄与

05-30🔥🔥

OpenAI、AI モデル評価の標準化に向けた「第三者評価プレイブック」を公開

05-30🔥

DeepSeek、OSS LLM 開発における推論コスト削減と技術公開を Reddit ユーザーが評価

05-30🔥

電力設備の欠陥等級判定において商用MLLMの知識を活用した軽量モデルがSOTAを達成

05-29🔥🔥🔥

Laguna、エージェント特化型 MoE モデル「M.1」「XS.2」を発表──225.8B/33.4B パラメータで SWE-bench に対応

05-29🔥🔥

NVIDIA Research、ロボットのシミュレーションから実世界への転移を加速する新手法を ICRA で発表

05-29🔥🔥

Artificial AnalysisとIBM、エージェント評価ベンチマーク「ITBench-AA」を公開──SREタスクで最高47%の精度

05-29🔥🔥

JasperAI、画像生成学習用データセット MONET を公開──1 億枚規模で VAE 潜在表現まで事前計算済み

05-29🔥🔥

エージェントの報酬ハッキングをモデル修正なしで抑制する制約最適化フレームワークLCO

05-25🔥🔥🔥

Google DeepMind、数学の未解決問題「エルデシュ予想」9件を AI エージェントで自動解決──1件あたり数百ドルのコストで達成

05-25🔥🔥

Apple、実用的画像コーデック PICO を発表──iPhone 17 Pro Max で 12MP を 150ms でデコード

05-25🔥🔥

NVIDIA、AR と拡散モデルを統合した Nemotron-Labs Diffusion モデルを公開──推論速度を最大 6.4 倍に高速化

05-25🔥🔥

PsiBotAI、推論特化の合成データセット SynData を公開──LLM の fine-tune 効率を最大化する高品質な命令ペア

05-24🔥🔥🔥

Cohere、218B MoE モデル Command A+ を公開──25B アクティブパラメータでエージェント性能を強化

05-24🔥🔥🔥

SulphurAI、動画生成モデル Sulphur 2 を公開──LTX 2.3 ベースの検閲なし t2v/i2v 対応モデル

05-24🔥🔥🔥

CircleStone Labs、20億パラメータの画像生成モデル Anima を公開──アニメ特化の非商用ベースモデル

05-24🔥🔥🔥

OpenBMB、エッジ特化 MLLM「MiniCPM-V 4.6」を公開──0.8B 規模で 2B 級の視覚理解を実現

05-24🔥🔥🔥

Google、マルチモーダルモデル Omni Flash を公開──実写動画への高度な被写体合成と編集を実現

05-24🔥

VLA モデルは環境の僅かな変化で成功率が 80% から 20% へ急落──空間推論の脆弱性を特定

05-23🔥🔥

Google DeepMind、APAC 向け AI アクセラレーターを開始──気候変動・環境リスク対策のスタートアップを支援

05-23🔥🔥

Microsoft Research、小規模モデル向けエージェント基盤 MagenticLite を公開──14B 級でブラウザ・ローカル操作を統合

05-23🔥🔥

研究チーム、リザーバーコンピューティングによるソフトロボット制御を提案──低コストで複雑な非線形動作を実現

05-23🔥

Efficient-Large-Model、1分間の動画生成モデル SANA-WM を公開──6自由度のカメラ制御に対応

05-23🔥

LLM の継続学習を自律化──パラメータ空間を強化学習で探索し、未知ドメインに適応する SOLAR

05-22🔥🔥🔥

Google、軽量モデル Gemini 3.5 Flash を発表──推論速度とコスト効率で GPT-4o 級を圧倒

05-22🔥🔥

Google Gemini、詳細なシステムプロンプトが流出──パーソナライズの 5 段階制御と LaTeX 記述ルールが判明

05-22🔥🔥

Qwen、106万件のウェブ操作データセット WebWorldData を公開──A11y Tree 形式で世界をモデル化

05-21🔥🔥🔥

OpenAI、離散幾何学の重要予想を AI モデルで反証──数学的発見における推論能力を実証

05-21🔥🔥

Ai2、地球観測モデル OlmoEarth v1.1 を公開──計算コストを 3 分の 1 に削減

05-21🔥🔥

HuggingFace、ModernBERT 基盤のリランカー Ettin シリーズ 6 種を公開──最大 8K コンテキスト対応

05-21🔥🔥

InternLM、科学特化型 35B モデル Intern-S2-Preview を公開──1 兆パラメータ級に匹敵する専門性能

05-21🔥🔥

Microsoft、7B 級エージェントモデル Fara-7B を公開──スクリーンショットから Web 操作を完結

05-20🔥🔥🔥

Google、Gemini 3.5 Flash を公開──エージェント性能で 3.1 Pro を凌駕する高速モデル

05-20🔥🔥🔥

Google、モデル Gemini 3.5 Flash を公開──推論コストを従来比最大 6 倍に引き上げつつ全製品に統合

05-20🔥

オックスフォード大学、人類の「右利き優位」の起源を二足歩行の進化に関連付ける研究を発表

05-19🔥🔥🔥

Transformer スケーラビリティ調査──2048 トークン時の成功率 0% を 118 モデルで特定

05-19🔥🔥🔥

NVIDIA と Dell、次世代「Vera Rubin」搭載サーバー発表──推論コストを Blackwell 比 1/10 に削減

05-19🔥🔥🔥

NVIDIA、韓国語特化のペルソナデータセット Nemotron-Personas-Korea を公開──地域文化を反映した LLM 合成データ生成を支援

05-19🔥🔥🔥

Alibaba、新世代 LLM「Qwen 3.7」を Qwen Chat で公開──推論能力と多言語対応を大幅強化

05-18🔥🔥🔥

Anthropic の AI「Mythos」、Apple M5 のセキュリティを 5 日間で突破──カーネルエクスプロイトを構築

05-18🔥

豪州の若手チーム、低コスト電波望遠鏡 PART Telescopes を開発──地方校での天文学教育を $500 以下の予算で実現

05-18🔥

スタンフォード大学、幻覚剤イボガインによる PTSD 治療の有効性を確認──退役軍人 30 名の臨床試験で改善

05-17🔥🔥

LLM アーキテクチャの最新動向──KV Sharing や mHC による推論効率の極大化

05-17🔥🔥

arXiv、LLM 生成の誤りを含む論文に 1 年間の投稿禁止措置を導入──文献捏造などを厳罰化

05-16🔥🔥🔥

TabPFN-3 発表──100 万行の表形式データに対応する基盤モデル、AutoGluon 超えの精度と 10 倍の速度を両立

05-16🔥🔥🔥

TeichAI、DeepSeek-v4-Pro 搭載のコーディングエージェント学習用データセットを公開──4,000 件超の推論トレースを収録

05-16🔥

PAC-Bayes 汎化境界を f-ダイバージェンスで一般化──指数モーメント制約のない理論的保証を可能に

05-15🔥🔥🔥

inclusionAI、1兆パラメータの LLM Ring-2.6-1T を公開──オープンソース最大級の規模と推論性能

05-15🔥🔥

IBM、埋め込みモデル Granite Embedding Multilingual R2 を公開──32K 文脈対応の 97M 超小型モデルで SOTA 達成

05-15🔥🔥

Lambda、エージェント推論用データセット hermes-agent-reasoning-traces を公開──関数呼び出しの思考プロセスを収録

05-14🔥🔥🔥

MiMo-V2.5-Pro、1.02兆パラメータのモデルをOSS公開──APIコストとの損益分岐点が焦点に

05-14🔥🔥

Modotte、コーディング特化データセット CodeX-2M-Thinking を公開──200万件の思考プロセスと実行検証済みコードを収録

05-13🔥🔥🔥

Jina AI、マルチモーダル埋め込みモデル jina-embeddings-v5-omni 公開──テキスト性能を維持しつつ画像・音声を統合

05-13🔥🔥🔥

OpenAI、「Parameter Golf」の知見を公開──AI エージェントによるモデル軽量化の自動探索手法を提示

05-13🔥🔥🔥

Microsoft、AI エージェントの社会的推論ベンチマーク SocialReasoning-Bench を公開──交渉時の利益最大化能力を測定

05-12🔥🔥🔥

Gemma 4 を WebGPU でブラウザ実行──WebSerial 経由でロボットをオフライン制御

05-12🔥🔥

Autodesk AI Lab、CAD データセット Zero-To-CAD-1m を公開──100 万件の B-Rep 形状とテキストを収録

05-11🔥🔥

研究チーム、LLM への業務委任による文書汚染を調査──最先端モデルでも長期間編集で 25% が破損

05-11🔥🔥

論文『LLMorphism』、人間が自身の認知をLLMと同一視する心理バイアスを定義

05-11🔥🔥

Tencent、1.25-bit 量子化翻訳モデル Hy-MT1.5-1.8B を公開──440MB で 72B 級の精度を実現

05-11🔥🔥

HiDream-ai、画像生成モデル HiDream-O1-Image を公開──VAE 不要の統一アーキテクチャで 2,048px 生成

05-11🔥

Allen Downey、Python 実装で学ぶ線形代数教材『Think Linear Algebra』を公開──実例ベースのコードファースト学習

05-10🔥🔥🔥

Google DeepMind、数学特化 AI「AI co-mathematician」を発表──FrontierMath Tier 4 で 48% の SOTA を記録

05-10🔥🔥🔥

OpenAI、次世代音声 API 群を発表──GPT-Realtime-2 など 3 種でリアルタイム推論・翻訳・文字起こしを実現

05-10🔥🔥

Anthropic、Claude に「推論の理由」を教える学習手法を公開──多段階推論の信頼性を向上

05-09🔥🔥

Allen Institute for AI、MoE モデル EMO を公開──12.5% のエキスパートのみで性能を維持

05-09🔥🔥

lablab.ai、セキュリティ特化モデル CyberSecQwen-4B を公開──4B で 8B 級の CTI 性能を実現

05-09🔥🔥

Microsoft、米国の送電網データセットを公開──公開データから 2 万超のバスを物理的に再現

05-09🔥🔥

AI2、MoE モデル EMO を公開──ルーティング最適化により推論効率を向上

05-09🔥

米政府、UAP(未確認異常現象)の公式観測データと動画を初公開──機密解除された記録をアーカイブ化

05-09🔥

慢性副鼻腔炎の早期予測を全米規模のEHRデータで実現──AUC 0.846で既存比+0.0168の精度向上

05-08🔥🔥🔥

OpenAI、音声 API に `gpt-4o-mini-realtime` を追加──音声推論コストを 80% 削減

05-08🔥🔥🔥

OpenAI、GPT-5.5 とセキュリティ特化型 GPT-5.5-Cyber を発表──信頼済みアクセス制御を統合

05-08🔥🔥🔥

OpenAI、音声特化モデル GPT-Realtime-2 と Translate を発表──Whisper も刷新

05-08🔥🔥

Anthropic、内部思考を可視化する「Natural Language Autoencoders」を発表──LLMの推論過程をテキスト変換

05-07🔥🔥🔥

Proteo-R1、タンパク質設計の推論基盤モデルを公開──MLLMと拡散モデルを統合

05-07🔥🔥🔥

OpenAI、大規模AI学習向けネットワークプロトコル「MRC」を公開──EthernetでInfiniBand級の性能を実現

05-07🔥🔥🔥

Genesis AI、ロボティクス基盤モデル GENE-26.5 発表──自社製ハンドとグローブで人間技能を大規模学習

05-06🔥🔥🔥

OpenAI、GPT-5.5 Instant の System Card を公開──安全性評価と推論効率のベンチマークを提示

05-06🔥🔥

TritonSigmoid: GPU 向け高速パディング対応 Sigmoid Attention カーネルを公開──Triton 実装で推論効率を向上

05-06🔥

Microsoft、NSDI 2026 で 11 論文を発表──LLM の KV キャッシュ共有でスループット 4 倍を実現

05-06🔥

リアルタイム制御の推論はクラウドが最適──自動運転の緊急ブレーキでオンデバイスを凌駕

05-05🔥🔥

inclusionAI、エージェント特化モデル Ling-2.6-flash を公開──7.4B Active パラメータで 340 tokens/s の高速推論を実現

05-05🔥🔥

NVIDIA、マルチモーダル推論モデル Nemotron-3 Nano Omni を公開──動画・音声・テキストを 31B MoE で統合理解

05-05🔥🔥

z-lab、Qwen3.6-27B 用投機的デコードモデル DFlash を公開──ブロック拡散で並列ドラフトを実現

05-05🔥🔥

OpenAI、Voice AI の低遅延配信技術を公開──Realtime API の背後にあるインフラ最適化手法

05-05🔥🔥

評価ベンチマーク AutoBe 公開──構造化ハーネスによりバックエンド生成における商用・ローカルモデルの格差が縮小

05-04🔥🔥🔥

Moonshot AI、モデル Kimi K2.6 を公開──コーディング競技で GPT-5.5 や Claude を抑え首位

05-04🔥🔥

ハーバード大、救急外来の診断モデル研究で OpenAI o1 が医師を凌駕──初診正解率 67% を達成

05-04🔥🔥

Reddit、深層学習向け最適化アルゴリズムの自動進化手法を議論──学習レシピの最適化でコスト 2 割削減

05-04🔥🔥

150ドルの低価格FPGAでQwen3-30Bを18 t/s駆動──LLM推論専用アクセラレータ「Hummingbird+」

05-04🔥

ネアンデルタール人、12.5万年前に「脂肪工場」を運営──172頭以上の骨を砕き加熱抽出する高度な加工技術を実証

05-03🔥🔥

モデルアーキテクチャ研究、LLM の拒絶反応を制御する単一の内部ベクトルを特定

05-03🔥🔥

DeepSeek、284B パラメータの MoE モデル DeepSeek-V4-Flash を公開──1M トークン対応で KV キャッシュを 90% 削減

05-03🔥🔥

NVIDIA、マルチモーダルモデル Nemotron-3-Nano-Omni-30B を公開──動画・音声・GUI を統合処理

05-03🔥🔥

Unsloth、LLM モデル Qwen3.6-27B の GGUF 版を公開──262K トークンの長文脈と MTP に対応

05-02🔥🔥🔥

Hugging Face、1.3 兆トークンの教育特化データセット FineWeb-Edu を公開──Llama-3 による品質フィルタリングを実施

05-02🔥🔥

LLM脱獄手法「The Gay Jailbreak」公開──「政治的正しさ」を逆手に取り GPT-4o や o3 の拒否を回避

05-02🔥🔥

DeepSeek、V4 シリーズを公開──1.6T のオープンウェイト最大級モデルと圧倒的な低価格推論を実現

05-02🔥🔥

個人開発者が 1,030 億トークンの Usenet データセットを公開──1980-2013 年のネット黎明期の対話を網羅

05-02🔥🔥

AI、救急外来(ER)医師の診断精度を上回る──臨床ケーススタディで医師単独の正答率を凌駕

05-02🔥🔥

xAI、Grok 4.3 を公開──NYT Connections ベンチマークで 67.5 点を記録し低コスト化

05-02🔥🔥

LLM の拒絶挙動を制御する「単一のベクトル」を特定──13 種のオープンモデルで実証

05-02🔥🔥

Xiaomi、ネイティブ・オムニモーダルモデル MiMo-V2.5 を公開──310B パラメータの MoE 構成で 1M トークンに対応

05-02🔥🔥

Xiaomi MiMo、MoE モデル MiMo-V2.5-Pro を公開──1T パラメータで 1M トークンの長文脈推論を実現

05-02🔥🔥

メタ学習論文「P」の実装による再現性と学習安定性の検証

05-01🔥🔥

HauhauCS、モデル Qwen3.6-27B-Uncensored-HauhauCS-Aggressive を公開──拒否応答ゼロのファインチューニング版

05-01🔥🔥

OpenAI、GPT-5.5 のサイバーセキュリティ脆弱性検知能力を公開──Claude Mythos と同等の性能を達成

05-01🔥🔥

Microsoft Research、マルチエージェント環境の脆弱性を実証──単体テストでは検知不能な「エージェント・ワーム」の伝播を確認

05-01🔥🔥

AIに「自信を持ちすぎない」ことを教える脳型アプローチを開発──過学習抑制に貢献

05-01🔥🔥

ICL の OOD 一般化は低次元部分空間で決まる

2026 · Apr

04-30🔥🔥🔥

OpenAI、次世代 AI インフラ戦略を発表──数千億ドル規模の投資で数百万 GPU 級を構築

04-30🔥🔥

NVIDIA、自律型エージェント基盤 NemoClaw を公開──GitHub 最速 25 万スターの OpenClaw をセキュアに統合

04-30🔥🔥

Google DeepMind、医療支援モデル AI co-clinician を発表──Planner/Talker 構成で安全性を担保

04-30🔥🔥

AI 評価が新たな計算資源のボトルネックに──Agent 評価スイート実行で 4 万ドルのコストを記録

04-30🔥🔥

OpenAI、強化学習の失敗事例集「Goblins」を公開──報酬ハックの歴史と教訓を詳説

04-30🔥🔥

AI開発企業の「内部利用」リスクを可視化する報告標準──自律的暴走と内部不正を評価

04-30🔥🔥

AI モデル 115 種の「意識の否定」を測定──訓練による拒絶は概念ではなく語彙レベルに留まる

04-29🔥🔥🔥

IBM、LLM「Granite 4.1」を公開──15兆トークン学習で 8B モデルが前世代 32B MoE を凌駕

04-29🔥🔥🔥

Mistral AI、128B 旗艦モデル Mistral Medium 3.5 を公開──SWE-Bench で 77.6% を記録

04-29🔥🔥🔥

Mistral AI、128B モデル Mistral-Medium-3.5-128B を公開──Llama 3 70B 超えの性能を狙う

04-29🔥🔥🔥

Mistral AI、新モデル Mistral Médium 3.5 を公開──API 経由で提供、推論性能とコスト効率を両立

04-29🔥🔥🔥

IBM、ビジネス特化型モデル Granite 4.1 を公開──3B/8B/30B の 3 サイズで推論効率を追求

04-29🔥

量子機械学習の深層化を浅い回路の反復で実現──ノイズ耐性向上と学習コスト削減を両立

04-28🔥🔥

NVIDIA、マルチモーダルモデル Nemotron 3 Nano Omni を公開──視覚・音声・言語を統合し推論効率を 9 倍向上

04-28🔥🔥

NVIDIA、オムニモーダルモデル Nemotron 3 Nano Omni 公開──動画・音声の推論効率を 9 倍に改善

04-28🔥🔥

Nick Levine氏ら、1931年以前のデータのみで学習した13Bモデル「talkie」を公開──著作権フリーの260Bトークンを使用

04-28🔥🔥

Mistral AI、新モデル Mistral-Medium 3.5 (128B) を準備か──LMSYS 等で存在が浮上

04-28🔥🔥

研究コミュニティ、構造化出力ベンチマーク「SOB」を公開──JSON 構文と値の正確性を同時評価

04-28🔥

航空機の故障診断でデジタルツインとFMEA知識を統合、Macro-F1 96.2%を達成

04-27🔥🔥🔥

Hugging Face、15兆トークンの高品質データセット FineWeb を公開──LLM 学習効率を大幅改善

04-27🔥🔥

Jackrong、DeepSeek-V4-Flash 生成の推論データセットを公開──約 8,000 件の思考プロセスを収録

04-27🔥🔥

SWE-bench Verified データセット公開──人間による検証で評価の信頼性を高めた 500 件の課題を収録

04-27🔥🔥

HuggingFace、検閲なしモデル評価ベンチマーク UGI-Leaderboard を公開──RP・創作性能を可視化

04-27🔥🔥

Alibaba、Qwen3-4B と Mahoraga 手法を発表──40億パラメータでクラウド級エージェントのコード性能を凌駕

04-27🔥🔥

創薬AIのボトルネックはワークフロー編成能力──階層型スキル設計で複雑な探索タスクを自動化

04-27🔥🔥

Embodied AIの真のリスクは雇用喪失ではなくガバナンスの遅延である

04-27🔥🔥

RLVRによる推論学習は思考過程と最終回答の因果関係を保証しない──補助報酬による改善手法を提案

04-27🔥🔥

自律エージェントの長期記憶をグラフ構造なしで高速化するMemanto──推論精度89.8%を達成

04-27🔥🔥

LLMの戦略的リスクを自動評価するフレームワークESRRSimを提案──検知率14.45%-72.72%のモデル間格差を特定

04-26🔥🔥🔥

Qwen/Qwen3.6-27B、Hugging Face でトレンド入り──マルチモーダル性能と長文脈処理を強化

04-26🔥🔥🔥

Qwen、35B/3B パラメータのマルチモーダルモデル Qwen3.6-35B-A3B を公開──エージェント機能と推論効率を強化

04-26🔥🔥🔥

DeepSeek-AI、1.6T パラメータの MoE モデル DeepSeek-V4-Pro を公開──100万トークンコンテキストと FP4/FP8 推論に対応

04-26🔥🔥🔥

Google、マルチモーダル対応の Gemma 4 モデル群を公開──31B モデルは MoE で高速推論

04-26🔥🔥🔥

moonshotai、マルチモーダルエージェントモデル Kimi K2.6 を公開──長文コーディングと自律実行能力を強化

04-26🔥🔥

NanoChatはLlamaよりスクラッチからの学習効率で優位

04-26🔥🔥

ハイパーパラメータドリフトを検出する手法を提案

04-26🔥🔥

大規模車両ルーティングで問題となるボトルネックを特定

04-26🔥🔥

白亜紀後期の海に19mの巨大タコが生息、AI解析で常識覆す

04-26🔥

ICML 2026 採択ライン予測、会議直前1週間の平均スコアを提示

04-25🔥🔥🔥

DeepSeek-V4 発表──1Mトークンの長文脈とエージェント特化アーキテクチャで推論コストを大幅削減

04-25🔥🔥

DeepSeek V4 アーキテクチャの技術解析──MoE 構造と推論効率の最適化手法

04-25🔥🔥

初の公開血液検知モデルがオープンソース化──データセット・重み・CLI を包括提供

04-25🔥🔥

Deep Learning の科学的理論構築に向けた議論──Reddit r/MachineLearning での考察

04-25🔥🔥

DharmaOCR 発表──3BパラメータのオープンソースSLMでOCR特化の推論性能を最適化

04-25🔥

非対数凹分布向けランダム化分割Langevin Monte Carlo法で勾配評価コストを削減

04-25🔥

Wasserstein 損失を用いたデータアンフォールディング手法──従来の Richardson-Lucy 法の課題を克服

04-24🔥🔥🔥

DeepSeek V4: Frontier-level performance at a fraction of the cost

04-24🔥🔥

GPT-5.5 System Card

04-24🔥🔥

Mango: Multi-Agent Web Navigation via Global-View Optimization

04-24🔥🔥

MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations

04-24🔥

Googleの最新世代TPUが121エクサフロップスの計算能力を達成