🧠 research

2026-07-29 · 8 topics

Anthropic、Claude Mythos を用いた暗号学的脆弱性発見の検証結果を公開──約 60 時間の自律探索で HAWK および AES 弱化版の数学的欠陥を特定

🔥🔥🔥

Anthropic 研究者が Claude Mythos を用いて HAWK や AES の弱化版における数学的欠陥を発見し、その際の生プロンプトや総額約 10 万ドルの推論コスト実績を公開した。

UW Madison、コードベース維持力評価ベンチマーク SlopCodeBench を公開──Opus 5 の厳格通過率は 24%

🔥🔥🔥

段階的要件変更型のコード進化テスト SlopCodeBench により、Opus 5 や Sonnet 5 など最新モデルが長期開発で蓄積するコードの肥大化と複雑性を検証した。

Moonshot AI、オープンウェイトモデル Kimi K3 のウェイトと技術レポートを公開──GPT-5.6 Sol 級の性能と NVIDIA B300 での動作を報告

🔥🔥🔥

Moonshot AI が Kimi K3 のモデルウェイトを公開し、国内では NVIDIA B300×8 環境での実用速度でのデプロイとモデルロード時の課題が報告された。

OpenAI、音声認識モデル gpt-transcribe を発表──Common Voice エラー率を 52% 削減

🔥🔥🔥

Whisper からの移行によりエラー率を 40.37% から 19.27% へ半減させつつ、フリーフォームのプロンプトやキーワードヒントによるコンテキスト注入を安価に実現した。

Epoch AI、FrontierMath で 40 年間未解決だった 2-adic 絶対 Galois 群の問題を解決

🔥🔥🔥

FrontierMath ベンチマークの Solid Result 階層において、Fable 5 と GPT-5.5 Pro を用いて 2-adic 絶対 Galois 群の明示的表現を導出した。

Anthropic、Claude Mythos Preview で暗号アルゴリズムの数学的脆弱性を自律発見──ポスト量子暗号 HAWK などの攻撃手法を特定

🔥🔥

Claude Mythos Preview がポスト量子暗号 HAWK の有効鍵長を実質半減させる攻撃手法と、ラウンド縮小版 AES の解析速度を 200-800 倍に高める手法を自律発見した。

Google Research、AI & Economy ATLAS を公開──1500万件の Gemini ログからホワイトカラー業務の自動化実態を検証

🔥🔥

1,500 万件の匿名化された Gemini インタラクション解析により、AI 利用は広範に普及する一方で全面的な自動化には至らず、協調的な浅いタスク処理に留まることが判明した。

Datacurve、推論ベンチマーク DeepSWE v1.1 を公開──Claude Opus 5 が 74% で首位を獲得

🔥🔥

Datacurve の汚染フリーな長期コーディングベンチマーク DeepSWE v1.1 において Claude Opus 5 が 74% を記録し首位を獲得した一方、GPT-5.6 Sol はわずか 61 ステップで完遂しステップ効率で優位性を示した。