NVIDIA、3D CT VLM モデル NV-Reason-CT を公開──ボリューム全体の推論と対話型解析を実現
3D CT の連続スライスをそのまま処理する 3D ViT と Qwen3.5-4B を組み合わせ、放射線科医の思考プロセスを模倣する推論トレースとマルチステップ対話を実現した。
リリース: 2026-09-23 · 読了 3 分記事の要約
1. 核心(What)
- NVIDIA は、3D 撮影された CT スキャンを直接処理するオープン開発向け VLM「NV-Reason-CT」を公開した。
- モデルは胸部と腹部の 30 および 29 の異常をカバーする専用の CT オントロジーに基づき、構造化レポートを生成する。
- 学習データには、CT-RATE や NIH CT datasets を含む約 55 万件の構造化 QA 例および専門医の推論データを使用している。
- モデルのアーキテクチャには Qwen3.5-4B を言語モデルとして採用し、エンドツーエンドの再学習を実施している。
2. 影響(Why)
- 医用画像解析の構造的制約の突破: 従来の 2D エンコーダに依存したモデルとは異なり、3D の空間的連続性を保持したまま推論を行えるため、医療現場での信頼性が求められる複雑な診断サポート基盤として実用的な選択肢になる。
- 国内医療機器・画像診断システム開発への影響: [国内 医療機器メーカーや医療 SaaS 事業者] などのチームは、商用 API に依存しないオンプレミス環境や VPC 内での高度な医用画像 RAG および対話型診断支援ツールの検証基盤として本モデルを活用できる。
3. 根拠・詳細(How)
- 3D ViT と 3D MRoPE による空間保持: Primus 3D ViT と Colipri の重みで初期化されたエンコーダを使用し、192³ ボクセル(2mm 等方解像度)にリサンプルされた CT ボリュームから 8x8x8 パッチで計 13,824 個のビジョントークンを抽出して LLM へ入力する。また 3D MRoPE により空間的関係性を保持する。
- 2段階の学習パイプラインと GRPO: 専門医の推論データを含む教師あり微調整(SFT)を実施した後、各解剖学的領域ごとの精度を報酬とする Group Relative Policy Optimization (GRPO) を適用して臨床的な正確性を最適化している。
4. 展望・課題(Next)
- オープン研究開発基盤としての位置づけ: 自律的な診断システムや臨床承認済みの医療機器ではなく、研究者や開発者が特定のユースケースに合わせてポストトレーニングを行うためのオープンな基盤として提供されている。