🧠 research

2026-08-01 · 8 topics

Epoch AI、未解決数学ベンチマーク FrontierMath を 50 問に拡張──AI がすでに 3 問を解決

🔥🔥🔥

Epoch AI が未解決数学の問題集 FrontierMath: Open Problems を 50 問に拡張し、GPT-5.6-Sol がそのうち 3 問を解決したことで評価の難易度が一段と引き上げられた。

Simon Willison、Oxide and Friends ポッドキャストで Open Weight モデルの最前線を議論──Kimi K3 の躍進とオープンウェイトの競争力を総括

🔥🔥

Kimi K3 による独自モデルの台頭やプロプライエタリモデルとの性能比較、さらには業界の安全保障を巡る公開書簡まで、オープンウェイト AI の現在地を多角的に検証した。

Philip Arathoon ら、物理学の「マクスウェル予想」が偽であることを証明──5 点電荷配置で 24 個の非退化臨界点を確認

🔥🔥

n 個の点電荷が持つ静電ポテンシャルの非退化臨界点は高々 (n-1)^2 個という 150 年近く信じられてきたマクスウェル予想に対し、初めて反例を数学的に構成した。

AlphaSignal、オープンモデルの進化の方向性を分析──4 つの戦略と 6 層の公開レイヤーを定義

🔥🔥

オープンモデルが推論効率や透明性など 4 つの目的に分岐したことで、重み公開の定義だけでは実運用での適合性を判断できなくなった。

Alibaba、音声認識モデル Qwen-Audio-3.0-ASR-Flash を公開──医療用語で 95.36% のリコール率を達成

🔥🔥

会話履歴をメッセージ API で渡すコンテキスト認識型の音声認識により、専門用語の認識精度を大幅に改善した。

DeepSeek、モデル評価ベンチマーク特化型モデル DeepSeek-V4-Flash-0731 を公開──上位版を超える agent ベンチマークを達成

🔥🔥

284B total / 13B active の MoE 構造と $0.28/M output の価格を維持したまま、SWE-bench Verified で 79% を記録した。

MiniMax、動画生成モデル H3 を公開──Artificial Analysis 編集部門で首位を獲得

🔥🔥

ネイティブ 2K 解像度とステレオ音声の同時生成に加え、最大 9 枚の参照画像や指示ベースの編集機能を備え、商用価格も競合比で約 1/3 に抑えた。

Audio8、軽量音声合成モデル Audio8-TTS-Preview-0.6b を公開──0.6B パラメータで 11 言語とゼロショット音声クローンに対応

🔥🔥

0.6B という極小パラメータながら SOTA 級の音声合成品質を実現し、ONNX INT4 版や SGLang Omni アダプターでオンプレミスや商用推論サーバーへの組み込みが容易になった。