🧠 research

2026-08-13 · 8 topics

SpaceXAI、AIモデル Grok 4.6 を発表──総合ベンチマークで GPT-5.6 Sol Max と同等スコアを記録

🔥🔥🔥

前世代から追加事前学習と領域固有の強化学習を施し、Artificial Analysis Intelligence Index で 61 を記録して上位モデルに迫った。

Qwen チーム、オープンモデル Qwen3.8-2.4T-A95B を公開──2.4T パラメータと 1M コンテキストを搭載

🔥🔥🔥

推論特化型の大規模オープンモデルとして最大規模となる 2.4T 総パラメータ版を公開し、vLLM や SGLang でのローカル運用に対応した。

Google DeepMind、手話翻訳モデル SL2T 1.0 を発表──Pixel 11 の Gboard と Live Transcribe に統合

🔥🔥🔥

Deaf コミュニティとの共同開発で構築された手話翻訳モデル SL2T 1.0 が Gboard と Live Transcribe に実装され、追加コストなしで利用可能になる。

LM Arena、Claude Opus 5 の出力文体分析モデルを公開──応答長が前世代比 3 倍に拡大

🔥🔥

LM Arena が数万件の実出力を解析し、Claude Opus 5 は前世代より 3 倍長い応答を生成する一方で抽象名詞を 53% 削減していることを実証した。

Upstage、フラッグシップモデル Solar Pro 4 を発表──人工知能指数で 28 ポイント増の 42 を記録

🔥🔥

OfficeVerse によるタスク完了型合成データ学習によりエージェント性能を刷新し、実世界エージェント Elo で人間基準を超える 1276 を達成した。

Cohere、2.4B の視覚言語モデル North Micro Vision Instruct を公開──A4 文書を縮小なしで直接読み取り DocVQA 0.921 を記録

🔥🔥

A4 サイズの文書画像をネイティブ解像度で直接処理し、商用利用可能な Apache 2.0 ライセンスで公開された軽量 VLM。

Liquid AI、視覚言語モデル LFM2.5-VL-3B を公開──エッジ端末での高速推論とマルチモーダル性能を最適化

🔥🔥

SigLIP2 400M をバックボーンに採用し、M5 Max で 228 tokens/s の高速動作とマルチ画像・UI 理解を実現した 3B モデル。

Google Research、LLM の知識プロファイリングフレームワークを公開──フロンティアモデルの事実誤認の主因は記憶漏れではなく想起失敗

🔥🔥

Gemini 3 や GPT-5 などのフロンティアモデルでは 95〜98% の知識がエンコードされているものの、26〜34% で直接想起に失敗していることを WikiProfile ベンチマークで実証した。