TaichuAI、マルチモーダルモデル ZDTaichu5.0-9B を公開──10B 規模で空間推論とエージェント性能を強化
Qwen3.5-9B と C-RADIOv4-H を統合し、128K 文脈長や Entropy-Gated 方式で 10B 帯トップの空間・エージェント性能を実現した。
リリース: 2026-09-04 · 読了 3 分記事の要約
1. 核心(What)
- ZDTaichu5.0-9B は汎用ビジョン理解、空間推論、エージェント利用、および身体性 AI (Embodied-AI) の研究を目的としたマルチモーダル基盤モデルである。
- ERQA で 48、RoboSpatial で 56 を記録し、 SparBench や ViewSpatial などの空間推論ベンチマークで 10B 級トップの性能を達成している。
- 静止画、複数画像、および長尺動画のイベント追跡・詳細検索を 128K トークンのコンテキストウィンドウ内でサポートする。
- 公式から vLLM v0.26.0 の専用カスタムブランチが Docker およびソースコード形式で提供され、OpenAI 互換エンドポイントを容易に構築できる。
2. 影響(Why)
- ローカル完結型エージェントの現実解: 10B 規模の軽量構成でありながら TAU2-Bench 87.7 のエージェント性能を持つため、クラウド API の利用料金やレイテンシを気にせずセキュアな業務システムを構築できる。
- 国内ロボティクス開発への波及: [国内 ロボティクス・FA機器ベンダー] のような現場では、クラウド接続が制限される環境下で 3D シーン理解やアフォーダンス予測を自己完結させるための有力なオープンソース選択肢となる。
3. 根拠・詳細(How)
- モデル構造と Entropy-Gated 機構: Qwen3.5-9B と C-RADIOv4-H をベースに、難度に応じた潜在空間の動的再帰的リファインメント(Entropy-Gated Adaptive Recurrent Reasoning)を導入し推論精度を高めている。
- vLLM v0.26.0 によるデプロイ仕様: 専用ブランチでは --mamba-ssm-cache-dtype float32 や --gdn-prefill-backend triton を指定し、CUDA 12.9 および Nvidia Driver 575.51.03 環境で稼働する。
4. 展望・課題(Next)
- 周辺エコシステムの追従: vLLM の公式メインストリーム版への機能マージや、更なる量子化バリアントの提供が今後の課題となる。