Huawei など、単一 32 GB GPU で学習可能な単眼深度推定モデル Marigold V2 を発表──既存の SOTA モデルを上回る Zero-shot 精度を達成
Qwen-Image-Edit-2509 をベースに 4-bit QLoRA ファインチューニングを適用し、1 ステップの高速推論と 2K 高解像度処理を両立した。
リリース: 2026-09-13 · 読了 3 分記事の要約
1. 核心(What)
- HUAWEI Bayer Lab などの研究チームが、単眼深度推定モデル Marigold V2 を発表した。
- Qwen-Image-Edit-2509 の拡散トランスフォーマー(DiT)をベースに、4-bit QLoRA を用いてファインチューニングを行っている。
- 32 GB のコンシューマー向け GPU 1 基で 1 週間未満でトレーニングが可能であり、推論は 1 ステップで実行される。
- NYUv2 や KITTI を含む複数の標準ベンチマークで従来の最高精度モデルを上回る Zero-shot 精度を記録した。
2. 影響(Why)
- ローカル環境での高精度深度推定の現実解: 従来の SOTA 級深度推定モデルが 80 GB GPU や分散学習を前提としていたのに対し、32 GB GPU 1 基で同等以上の精度を出せるため、ローカルマシンでの検証・開発コストが大幅に低下する。
- 国内の 3D・ビジョン系 SaaS 開発への影響: 3D 再構築や AR アプリを手がける国内の中規模ベンチャーは、高価なサーバー投資を抑えつつ、2K 解像度で動く単眼深度推定機能を自社パイプラインへ組み込めるようになる。
3. 根拠・詳細(How)
- 4-bit QLoRA によるメモリ最適化設計: バックボーンを 4-bit 精度に量子化しつつ rank-128 の QLoRA アダプターを追加することで、凍結された量子化バックボーンを維持しながら少数の低ランクパラメータのみを更新し、VRAM 消費量を劇的に削減している。
- iREPA-depth と SinkLoss による構造化最適化: DINOv3 特徴アライメントを利用する iREPA-depth と、タイルごとの Sinkhorn 最適輸送問題に基づく SinkLoss を採用し、境界の曖昧な領域でも高精度なピクセル単位の予測を実現している。
4. 展望・課題(Next)
- 多様なモーダルへの拡張予定: 同じバックボーンを用いて法線(normals)やアルベド(albedo)の推定、さらにスパース lidar を用いた深度補完への対応が進められている。