🧠 research

2026-09-15 · 8 topics

Artificial Analysis、評価ベンチマーク Capability Indices v1.1 を公開──O*NET 職業データに基づく 6 業界別の検証モデル

🔥🔥

O*NET 職業データベースの業務特性に合わせベンチマーク配分を再構築し、Claude Fable 5.1 が全 6 業種で首位を獲得した。

DeepSeek、効率特化モデル DeepSeek-V4.1-Flash を公開──552B MoE で KV キャッシュを 1/4 に圧縮

🔥🔥

552B と大型化しながら KV キャッシュ量を 890 バイト/トークンへ削減し、長文脈エージェントの運用コストを大幅に引き下げた。

Sakana AI、逆伝播なしで深層学習を行う学習手法 PC-ALM の論文を公開──1,000 層の残差 MLP 学習を実証

🔥🔥

逆伝播のバックプロパゲーションを使わず層間ローカル通信のみで 1,000 層の残差 MLP 学習に成功し、MNIST で標準逆伝播と 2% 以内の精度差を達成した。

Amazon Science、ML 研究エージェントがベンチマーク過学習を起こさない仕組みを解明

🔥🔥

LLM の莫大な背景知識を利用した戦略の高度な圧縮が、再利用されたベンチマークでの過学習を防ぐ鍵であることを実験で証明した。

Allen AI、科学研究エージェント AutoDiscovery を公開──ワシントン大学の授業でバッテリー老化などの仮説検証を実施

🔥🔥

Allen AI が公開した科学研究エージェント AutoDiscovery を用い、ワシントン大学の学生が 25 チーム中 10 チームのプロジェクトで仮説検証とデータ解析の精度を検証した。

IFM、推論特化コードデータセット Code-Reasoning を公開──K2 Horizon コレクション傘下で Parquet 形式配信

🔥🔥

K2 Horizon コレクションの一部として、思考プロセス付きコードデータや直接解答など複数サブセットを Parquet 形式で提供する。

Entelligence、コードレビュー特化低価格モデル GPT-5.6 Luna を評価──コストを 1/28 に抑える性能と精度検証

🔥🔥

GPT-5.6 Luna と GPT-6 Astra のプルリクエスト検証により、安価なモデルは日常的なバグ検出で実用的な一方、認証や権限ロジックでは精度の見劣りが明らかになった。

Google、宇宙飛行士 Christina Koch との対談動画を公開──国際宇宙ステーション滞在や AI と宇宙探査の協調を議論

🔥

NASA の Christina Koch 氏が James Manyika 氏と対談し、328 日間の宇宙滞在経験や宇宙探査における AI とロボティクスの役割を語った。