ONESTRUCTION、BIM特化基盤モデル Ishigaki-IDS を公開──AWS支援で構築した合成データパイプラインにより構造妥当性 100% を達成
Qwen3 をベースに CPT・SFT・RLVR の 3 段階学習を適用し、専門データの乏しい建設 BIM 領域における IDS 生成の正確性を大幅に高めた。
リリース: 2026-08-11 · 読了 3 分記事の要約
1. 核心(What)
- ONESTRUCTION は建設業界の BIM 標準である IDS の作成・検証を支援する基盤モデル Ishigaki-IDS を公開した
- Qwen3 の 8B、14B、32B スケールをベースに、継続的事前学習・SFT・RLVR の 3 段階の学習パイプラインを構築した
- 国際標準化機関 buildingSMART の IDS-Audit-Tool を報酬関数として利用し、XML の構文正当性と意味的一貫性を強化学習で最適化した
- AWS ParallelCluster を用いた Amazon EC2 P5en インスタンスと Amazon FSx for Lustre 上で分散学習を実行した
2. 影響(Why)
- ニッチ領域でのデータ不足を克服: 公開データが数千件に満たない建設 BIM 領域において、ドメイン知識を反映した合成データの大量生成と RLVR の組み合わせが、汎用モデルで発生する構造ハルシネーションを実用レベルまで抑制できることを示した。
- 国内建設セクターの BIM 導入加速: 国内の建設・設計業務で導入が進む BIM において、専門知識が要求される IDS ファイルの作成・検証コストを圧縮し、非専門家でも扱える作業環境を整備できる。
3. 根拠・詳細(How)
- 3 段階のドメイン特化トレーニング: Qwen3 をベースに、専門家監修の合成データを用いた継続的事前学習(CPT)、指示対データによる教師あり微調整(SFT)、IDS-Audit-Tool を報酬関数とする強化学習(RLVR)を順次適用した。
- 高スループットな分散学習インフラ: NVIDIA H200 Tensor Core GPU を備えた Amazon EC2 P5en インスタンス(p5en.48xlarge 2 ノード)を AWS ParallelCluster で管理し、Amazon FSx for Lustre でサブミリ秒の低遅延ストレージアクセスを確保した。
4. 展望・課題(Next)
- 長文脈処理のスケーリング: YaRN(Yet another RoPE extensioN)を用いたコンテキスト長のスケーリング対応を進め、より大規模な建築モデル全体の属性情報検証への適用を予定している。