2026-08-14 · 8 topics
Google DeepMind、推論モデル Gemini 3.7 Flash を発表──価格を前世代比半額に抑制しつつコーディング精度を大幅向上
🔥🔥🔥FrontierCode 1.1 Main で 43.6% を記録し、価格を 100 万トークンあたり入力 $0.75 / 出力 $3.75 に設定してエージェント開発コストを圧縮した。
DeepSeek、フラッグシップモデル DeepSeek-V4-Pro を正式公開──1.6T MoE と柔軟な推論制御で SWE-bench 80.6% を記録
🔥🔥🔥プレビューを終了した DeepSeek-V4-Pro は OpenAI Responses API 互換レイヤーを備え、フロントエンド開発の置き換えコストを競合比で約 1/7 に圧縮する。
Sarvam AI、音声エージェント基盤 Samvaad を公開──3.5 億件の実績と 11 言語対応
🔥🔥🔥これまでエンタープライズ限定だった音声エージェント基盤を全開発者向けに開放し、実運用 3 億 5,000 万件超の実績を持つ多言語インフラを手軽に試せるセルフサーブ型へ移行した。
HuggingFace、ICML 2026 論文 2,200 本の再現検証結果を公開──AI エージェントによる大規模検証で 23% に虚偽や誤りを検出
🔥🔥🔥ICML 2026 の採択論文に対しコミュニティがエージェントを用いて大規模な検証を実施し、再現成功・部分成功から数式破綻や評価の不備までを実証した。
Discovered Materials、AI エージェント用材料探索ベンチマークを公開──1 億トークン予算で結晶材料の合成レシピを自動評価
🔥🔥AI エージェントに Web 検索や Python サンドボックス、MLIP ツールを統合し、BEOL 互換の新素材と合成レシピの妥当性を検証するフレームワーク。
Perplexity、検索基盤 Search as Code を最適化──OpenAI と Anthropic を 5 ベンチマーク中 4 つで凌駕
🔥🔥エージェントが検索パイプラインを Python で動的構築する Search as Code により、タスク単価を約 10% 削減しつつ実行信頼性を 92.6% に向上させた。
Google、高速軽量モデル Gemini 3.7 Flash を発表──開発者向けベンチマークとコーディング性能を大幅強化
🔥🔥前世代の Gemini 3.6 Flash からわずか 3 週間でのリリースとなり、FrontierCode 1.1 などのコーディング指標で大幅な向上を達成した。
Apple ML Research、機械学習のデータ削除処理を高速化する手法 When Unlearning Is Free を公開──計算コストを最大約 50% 削減
🔥🔥モデル学習への影響が極小なトレーニングデータを事前に特定して除外することで、プライバシー対応の機械学習アンラーニングにおける計算コストを最大約 50% 圧縮するフレームワークを提案した。