2026-08-04 · 8 topics
Alibaba、フラッグシップモデル Qwen3.8-Max を公開──2.4兆パラメータで Anthropic 匹敵を主張
🔥🔥🔥Alibaba が 2.4 兆パラメータの Qwen3.8-Max をオープンウェイトで公開し、Arena.AI などのベンチマークで米国最先端モデルと並ぶ性能を示した。
OpenAI、数学・計算機科学の難問 10 件を解いた未公開モデル Astra を発表──全証明を Lean 4 で検証
🔥🔥長年未解決だった 10 件の数学の難問を未発表モデル Astra が解き、Lean 4 の機械検証済み証明を GitHub に公開した。
Epoch AI、MirrorCode ベンチマークを更新──Claude Fable 5 が 64% の解決率で GPT-5.6 Sol を圧倒
🔥🔥ソースコードなしのコンパイル済みバイナリから CLI プログラムを完全再実装させる MirrorCode ベンチマークで、Claude Fable 5 が GPT-5.6 Sol の 20% を引き離す首位を獲得した。
OpenAI、音声対話システム GPT-Live を公開──全二重通信と非同期推論で自然な会話を実現
🔥🔥ターン検出器を廃した全二重音声モデルにより、ユーザーの発話中に割り込みや相槌が可能になり、バックグラウンドでの GPT-5.5 連携を非同期処理化。
Alibaba Cloud、AIモデル Qwen3.8-Max を発表──2.4兆パラメータで一部ベンチマークが Claude Fable 5 超え
🔥🔥2.4兆パラメータを持つ大規模モデル Qwen3.8-Max が登場し、来週にはオープン化を予定。API 料金は 100 万トークンあたり入力 $2 / 出力 $6 に設定された。
Microsoft Research、エージェント学習フレームワーク Orchard を公開──3B パラメータで SWE-bench Verified 73.0% を達成
🔥🔥再利用可能な Kubernetes 環境と学習レシピにより、小型オープンモデルが商用フロントティアシステムに匹敵するエージェント性能を実現した。
トロント大など、自己複製型 AI コンピュータワームを開発──推論エンジンにオープンウェイト LLM を活用
🔥🔥オープンウェイト LLM と専用ハルネスを組み合わせた自己持続型 AI ワームのプロトタイプが発表され、全体攻撃成功率は約 37% を記録した。
Anthropic Claude Opus 5 デバッグベンチマーク検証──思考レベル引き上げによるコストと精度のトレードオフ
🔥🔥Claude Opus 5 の 4 段階の推論努力レベルを 260 回のデバッグ試行で検証し、Low から XHigh への引き上げで解決率が 4.7% 向上する一方コストが 477% 増加する実態を明らかにした。