2026-09-15 · 8 topics
Artificial Analysis、評価ベンチマーク Capability Indices v1.1 を公開──O*NET 職業データに基づく 6 業界別の検証モデル
🔥🔥O*NET 職業データベースの業務特性に合わせベンチマーク配分を再構築し、Claude Fable 5.1 が全 6 業種で首位を獲得した。
DeepSeek、効率特化モデル DeepSeek-V4.1-Flash を公開──552B MoE で KV キャッシュを 1/4 に圧縮
🔥🔥552B と大型化しながら KV キャッシュ量を 890 バイト/トークンへ削減し、長文脈エージェントの運用コストを大幅に引き下げた。
Sakana AI、逆伝播なしで深層学習を行う学習手法 PC-ALM の論文を公開──1,000 層の残差 MLP 学習を実証
🔥🔥逆伝播のバックプロパゲーションを使わず層間ローカル通信のみで 1,000 層の残差 MLP 学習に成功し、MNIST で標準逆伝播と 2% 以内の精度差を達成した。
Amazon Science、ML 研究エージェントがベンチマーク過学習を起こさない仕組みを解明
🔥🔥LLM の莫大な背景知識を利用した戦略の高度な圧縮が、再利用されたベンチマークでの過学習を防ぐ鍵であることを実験で証明した。
Allen AI、科学研究エージェント AutoDiscovery を公開──ワシントン大学の授業でバッテリー老化などの仮説検証を実施
🔥🔥Allen AI が公開した科学研究エージェント AutoDiscovery を用い、ワシントン大学の学生が 25 チーム中 10 チームのプロジェクトで仮説検証とデータ解析の精度を検証した。
IFM、推論特化コードデータセット Code-Reasoning を公開──K2 Horizon コレクション傘下で Parquet 形式配信
🔥🔥K2 Horizon コレクションの一部として、思考プロセス付きコードデータや直接解答など複数サブセットを Parquet 形式で提供する。
Entelligence、コードレビュー特化低価格モデル GPT-5.6 Luna を評価──コストを 1/28 に抑える性能と精度検証
🔥🔥GPT-5.6 Luna と GPT-6 Astra のプルリクエスト検証により、安価なモデルは日常的なバグ検出で実用的な一方、認証や権限ロジックでは精度の見劣りが明らかになった。
Google、宇宙飛行士 Christina Koch との対談動画を公開──国際宇宙ステーション滞在や AI と宇宙探査の協調を議論
🔥NASA の Christina Koch 氏が James Manyika 氏と対談し、328 日間の宇宙滞在経験や宇宙探査における AI とロボティクスの役割を語った。