Meta、OSS ライブラリ PyTorch 2.14 を公開──Apple Silicon 高速化と NVGEMM バックエンドを実装
2,995 件のコミットを経てリリースされた PyTorch 2.14 は、 Blackwell 向け NVGEMM や Apple Silicon 向け 100 倍超の演算高速化を標準搭載した。
リリース: 2026-09-11 · 読了 3 分記事の要約
1. 核心(What)
- Inductor の新バックエンドとして CuTeDSL 生成の CUTLASS パスである NVGEMM が追加された。
- c10d レイヤー向け nccl2 バックエンドがインツリー化され、インプレースでのプロセスグループ再構築が可能になった。
- Apple Silicon (MPS) 向けに SVD や eigh、lu_factor などのネイティブ Metal カーネルが実装された。
- 複数の形状宣言を統一する ShapeSpec API と @dynamic_spec デコレータが導入された。
2. 影響(Why)
- マルチノード訓練の復旧時間短縮: 従来のようにジョブ全体を再起動せずプロセスグループを再構築できるため、数千 GPU 規模のクラスタにおけるクラッシュ時のロスを数分単位で圧縮できる。
- Apple Silicon 実装の実用化: Mac 上でのプロトタイピングにおいて CPU フォールバックが解消され、MacBook 単体でモデルの挙動検証を完結させられる開発サイクルが手に入る。
3. 根拠・詳細(How)
- NVGEMM によるエピローグ融合: 行列積とバイアス加算・活性化関数を 1 つのカーネルに統合する epilogue fusion により、GPU メモリへの往復を削減し Blackwell の NVFP4 演算を加速。
- MPS ネイティブ線形代数: 旧来の CPU フォールバックを排除し、Jacobi 式カーネルや最適化された手書き Metal カーネルを導入することで small batched matrices で 100 倍超の高速化を実現。
4. 展望・課題(Next)
- API の安定化と Python 3.15 対応: API Unstable 指定の機能が多く、Python 3.15 での torch.compile の正式サポートを含め今後のパッチリリースでの仕様固めが予定されている。