2026-08-19 · 8 topics
Alibaba、オープンモデル Qwen 3.8 27B を公開──17GB のサイズで長文脈とマルチモーダルに対応
🔥🔥🔥Apache 2.0 ライセンスで公開された 27B パラメータのモデルだが、デフォルトの推論設定が過剰に思考するため実用時は調整が必要となる。
Alibaba、モデル Qwen3.8-2.4T-A95B-FP8 を公開──総パラメータ 2.4T・活性化 95B の推論特化型
🔥🔥🔥総パラメータ数 2.4T の MoE アーキテクチャを採用し、vLLM や SGLang で高スループットな推論が可能な FP8 量子化モデルを公開した。
Alibaba、推論モデル Qwen3.8 27B を公開──Artificial Analysis 評価で 52 を記録
🔥🔥27B パラメータ規模のオープンウェイト推論モデルとして、マルチモーダル入力と 256k トークンのコンテキスト長を実装した。
IBM Research、エージェント記憶最適化フレームワーク ALTK-Evolve を発表──8モデル評価で判明した適切なメモリ量の実証
🔥🔥エージェント記憶は一律に追加するのではなく、30B から 671B までの 8 モデルの能力差に応じて量を調整すべきであり、強モデルには全ガイドライン、弱モデルには選択的取得が最適である。
Microsoft 365 Copilot、未公開パラメータによる脆弱性を公開──対話的プロンプトでガードレールを回避
🔥🔥Varonis のセキュリティ研究者が Copilot に対する対話的な質問だけで認証スキップ用パラメータを特定し、ユーザー確認なしのデータ窃取に成功した事例の解説。
Allen AI、Olmo 3 の薬効理解に関する研究アーキテクチャを発表──薬名接辞への過依存を特定
🔥🔥Olmo 3 7B Instruct の検証で、テストした薬物の 51–59% に固有知識の欠如が見られ、12–18% が接辞駆動であることが判明した。
Apple ML Research、多言語設定における GRPO の大規模検証モデル論文を公開──英語中心の最適化手法を非英語圏へ拡張
🔥🔥Apple が非英語圏および多言語設定における GRPO を大規模に検証し、ネイティブ言語学習による推論能力の向上とクロスリンガル転移の効果を明らかにしました。
DeepSeek V4 Pro 0813 と GPT-5.6 Sol の DeepSWE 比較評価モデル──35倍の価格差と最適なカスケードルーティング手法の検証
🔥🔥DeepSeek V4 Pro 0813を初段に置き失敗時のみGPT-5.6 Solへエスカレーションするカスケード構成により、単体Sol比で精度+10%・コスト60%削減を達成した。