2026-09-02 · 8 topics
Anthropic、Claude Fable 5.1 と Claude Mythos 5.1 を発表──タンパク質設計とコード検証の性能を刷新
🔥🔥🔥高親和性バインダーのヒット率が 50% に達し、従来モデル比で推論コストを約 25% 削減した科学研究向けの新モデル。
OpenAI、次世代モデル Astra のセキュリティ性能を公表──ExploitBench で満点を記録しゼロデイ脆弱性を自律悪用
🔥🔥🔥OpenAI の次世代モデル Astra が同社の重要サイバーセキュリティ基準を初めてクリアし、未確認の脆弱性を自動発見・悪用する能力を持つことが明かされた。
個人開発者、小規模モデルアーキテクチャで ARC-AGI-1 44% を達成──学習時間 1.5 時間・コスト 67 セント
🔥🔥小規模 Transformer を用いたメタ学習アプローチにより、学習コストを大幅に抑えつつ多くの商用 LLM を凌駕するスコアを実証した。
Allen Institute、LLM ベンチマーク評価手法 BenchMIRT を公開──多次元 IRT で個別プロンプトの能力因子を分離
🔥🔥100 モデルと 34K 以上の質問を用いた検証により、BBQ や WMDP などの既存ベンチマークが安全性ではなく汎用推論能力を強く測定していることを明らかにした。
Google DeepMind、Gemini 3.7 Flash のモデル公開──動画解析コストを最大 66% 削減
🔥🔥固定 1 FPS のサンプリングに代わり、モデル自身がフレームや音声を動的に選択して読み込むエージェント型動画理解機能を Gemini API に追加した。
Anthropic、最新モデル Claude Fable 5.1 を公開──Intelligence Index 66 で最高スコアを記録
🔥🔥Artificial Analysis の指標でトップに立ちつつ、キャッシュ読み取り 75% 減と出力トークン増加によりタスク単価が 20% 上昇した。
Meta、リアルタイム音声認識モデル Muse Voice Transcribe を公開──3.1% の WER を記録
🔥🔥ASR・話者分離・エンドポイント検出を単一の自己回帰 LLM に統合し、Artificial Analysis ベンチマークで首位を獲得した。
Google、動画解析モデル Gemini 3.7 Flash などを公開──エージェント処理でトークン消費を 88% 削減
🔥🔥静的なフレームレート処理に代わり、モデル自らが動的に動画や音声を探索するエージェント型ビデオ理解機能を実装し、長文脈の解析コストを大幅に圧縮した。