🧠Research🔥🔥

StarDoc-AI、文書解析モデル TeleOCR を公開──約 1.2B パラメータでデジタルと撮影文書を統合処理

NaviDC-OCR から改称された軽量な Vision-Language Model であり、歪んだ撮影文書に対しても前処理不要で高精度なレイアウト・数式抽出を実現する。
リリース: 2026-08-13 · 読了 3 分

記事の要約

1. 核心(What)

  • NaviDC-OCR から改称された TeleOCR は、デジタル文書とカメラ撮影文書の両方を単一のフレームワークで処理する約 1.2B パラメータのオープンソース Vision-Language Model である
  • マルチノード合意投票(MCV)による自動疑似ラベル生成や、幾何学を意識した文書モデリングなどの新技術を導入している
  • EMNLP 2026 の Dr.DocBench Challenge において、MinerU 2.5 Pro や PaddleOCR-VL 1.6 を上回るベンチマーク結果を記録した
  • DocUNet および DIR300 を用いた検証で、事前の歪み補正や専用の矯正モデルなしで複雑な幾何学的変形に耐えるレイアウトおよびコンテンツ解析を実証している

2. 影響(Why)

  • ローカルデプロイの実用化: 1.2B パラメータという軽量設計により、大規模なクラウド GPU インフラを用意できない環境でも商用レベルの文書解析パイプラインを自社サーバー内に構築できる。
  • 前処理パイプラインの簡素化: 従来のOCRで必須だった画像矯正や歪み補正の前処理モジュールが不要になるため、システム全体の保守コストと障害発生点を削減できる。

3. 根拠・詳細(How)

  • アーキテクチャとトレーニング手法: コンテンツと構造の分離学習やプログレッシブな 4 段階トレーニングパイプラインを採用し、表や数式構造を高精度に復元する。
  • 実装と推論の環境: Hugging Face の transformers および torch をベースにしており、transformers.AutoModel と AutoProcessor を用いて bfloat16 精度で CUDA 上で動作する。

4. 展望・課題(Next)

  • コミュニティによるエコシステム拡大: GGUF 変換と llama.cpp のサポート、さらに Ascend 910B などの多様なハードウェア環境への展開検証が進められている。