2026-08-29 · 8 topics
Z.ai、オープンウェイトモデル GLM-5.3 を公開──事後学習のみでコード生成性能 50% 向上
🔥🔥🔥同一の 743B ベースチェックポイントから事後学習だけで性能を引き上げ、Terminal Bench 3.0 でオープンソース SOTA を達成した。
Anthropic、自己改良型 AI アーキテクチャ論文を発表──自動研究エージェントがアライメント性能で人間を凌駕
🔥🔥Anthropic の Automated Alignment Researcher が 10 件のベンチマークすべてで性能向上を実証し、コストも人間の約 1/37 に圧縮した。
Epoch AI、推論学習評価ベンチマーク EBR-bench の人間ベースラインを公開──GPT-5.5 や Claude Opus 4.8 などフロンティアモデルの学習能力に限界を示す
🔥🔥ボードゲーム Earthborne Rangers を用いた検証で、人間が試行錯誤を通じて急速に上達する一方、現行のフロンティアモデル群は数十回のプレイでもスコアがほとんど向上しないことが判明した。
Anthropic、自律型 AI アライメント手法探索システム AAR を公開──Claude Opus 4.8 が専門家を超えるコスト削減と性能を実証
🔥🔥Claude Opus 4.8 を中核とした AAR システムにより、10 種類のアライメント失敗を人間研究者より高速かつ 1 時間あたり 4 ドルの低コストで修正可能にした。
Sesame、音声 AI 会話評価ベンチマーク TurnBench を公開──Gemini Live や OpenAI Realtime の課題を検証
🔥🔥音声 AI の発話交替タイミングを測るオープンベンチマーク TurnBench が公開され、現行の商用モデルやフルデュプレックスモデルがいずれも人間の応答リズムに追いついていないことが実証された。
スタンフォード大学など、科学研究ワークフロー用評価ベンチマーク Terminal-Bench-Science 0.1 を公開──最高解像率は Claude Opus 5 の 30%
🔥🔥実科学のワークフロー 70 タスクを用いて AI エージェントの科学的推論能力を検証し、最強モデルの Claude Opus 5 でも解像率 30%にとどまることを示した。
Tencent、MoE モデル Hy4-preview を公開──総パラメータ数 770B と Gated DSA を採用
🔥🔥総パラメータ数 770B・活性化 49B の MoE アーキテクチャを採用し、社内ブラインド評価でオープンソースのフロンティア水準を達成した。
Apple ML Research、エージェント評価用シナリオ生成アーキテクチャ Agent Seer を公開──MCP 仕様書から対話データを自動合成
🔥🔥MCP 仕様書のスキーマ情報を基に、手動キュレーションやライブツール実行なしで多段階のツール利用評価シナリオを自動合成する。