2026-09-06 · 8 topics
NVIDIA、 Nemotron モデルで国際情報オリンピック首位──人間の最高得点を更新
🔥🔥🔥Nvidia の Nemotron-3-Ultra-CC が IOI 2026 で 535.4 点を獲得し、人間最高得点を上回るスコアを公式監視下で記録した。
DavidAU、Qwen3.8-27B-TURBO モデルを公開──思考トークン数を最大 1/10 に削減しつつ ARC-C 735 を達成
🔥🔥Qwen3.8 27B をベースに COLD FUSION 手法などで多段階ファインチューニングを行い、ベースモデル比で思考オーバーヘッドを劇的に圧縮しつつ商用クローズド級のベンチマークを実現した。
ISTA-DASLab、Qwen3.8-27B 用非一様量子化 GGUF モデル群を公開──GSU と RCO により 4.6 倍の圧縮率と AIME25 100.00 を両立
🔥🔥各重みテンソルに異なる量子化タイプを勾配ベース探索で割り当てる GSQ と RCO 手法により、IQ3_S モデルはベースモデル同等のタスク性能を維持しつつ 11.8GB へ圧縮された。
XHToken、軽量モデル Spark-X2.5-4B を公開──1M トークンコンテキストとハイブリッドアテンションを実装
🔥🔥約 20 兆トークンで事前学習され、1M トークンのネイティブコンテキストとハイブリッドアテンションを小型サイズで両立した。
Artificial Analysis、AI ベンチマーク Intelligence Index v4.2 を公開──非公開テストセットを 40% に倍増しハルシネーションとデータ汚染を防止
🔥🔥GPQA Diamond を廃止し、長期文書推論 GDP.pdf やエージェント評価 AA-Briefcase を導入することで、フロンティアモデルのカンニングと形骸化を防ぐ設計へ刷新された。
Cohere Labs、エージェント評価データセット ATE を公開──公開 MCP ツールで完全自動化できるのはわずか 2.6%
🔥🔥MCP サーバー 12 万件から収集した 69 万件以上のツールを O*NET データベースと突き合わせ、AI エージェントの実用限界を定量化した。
Zenn、知識グラフ構築の順序依存性を克服する FAMER アルゴリズムを解説──増分名寄せの精度維持
🔥逐次処理で発生する誤りの連鎖を防ぎ、バッチ処理と同等の精度を維持する増分エンティティ解決手法を整理した。
G検定のシラバス解析——配点 26% の「手法」を数式とコードで検証
🔥JDLA G検定シラバスの配点比率を基に、実装者が素通りしがちなディープラーニング手法の前提知識をコードと数式で棚卸しする。