今日の主役はオープンウェイトモデルの推論コストの再定義だ。Z.ai が公開した GLM-5.2 は、Claude Opus 級のベンチマーク性能を維持しつつ、推論コストを従来比で 1/5 以下に圧縮した。同日、華中科技大学らが 0.2B という極小パラメータで 10B 級の修復精度を叩き出す Moebius を発表したのも偶然ではない──「大規模=高性能」という前提は完全に崩れ、モデルの軽量化と高効率化が開発の主戦場に移ったと見ていい。周辺では OpenAI が Codex のロギングバグを修正し、年間 640TB もの不要なストレージ書き込みを削減したという報告もあり、インフラの最適化がモデル開発と同等の優先度で語られる時期に来ている。NVIDIA の JUPITER による量子シミュレーション記録更新と合わせ、計算資源の効率的利用をいかに設計に組み込むかが、今週のエンジニアリングの最重要課題だろう。