StarDoc-AI、軽量文書解析モデル TeleOCR を公開──デジタル・撮影文書を単一フレームワークで統合
約 1.2B パラメータの軽量 VLM ながら MinerU 2.5 Pro や PaddleOCR-VL 1.6 を上回る精度を達成し、歪み補正なしでカメラ撮影文書を直接解析可能。
リリース: 2026-08-13 · 読了 3 分記事の要約
1. 核心(What)
- StarDoc-AI は NaviDC-OCR から名称変更した軽量 Vision-Language Model「TeleOCR」のモデルウェイトと技術レポートを公開した。
- モデル規模は約 1.2B パラメータであり、デジタル文書とカメラ撮影による歪んだ文書の両方を単一のフレームワークで処理する。
- マルチノード合意投票や幾何学を意識した文書モデリング、曲線誘導ダグラス・ペッカーサンプリングなどの新手法を導入している。
- GGUF 変換版がコミュニティによって公開されており、llama.cpp や Ascend 910B 環境でのデプロイがサポートされている。
2. 影響(Why)
- 前処理パイプラインの劇的な簡素化: 従来のカメラ撮影文書で必須だった変形補正モジュールを介さず直接レイアウトを復元できるため、RAG 前段のインフラ構成を単一コンテナに集約できる。
- ローカル環境への容易な統合: 1.2B というパラメータ数により、単一のコンシューマー向け GPU やエッジ環境でも高速な推論が成立し、クラウド API 依存のセキュリティ制約をクリアしやすい。
3. 根拠・詳細(How)
- アーキテクチャと依存ライブラリ: MinerU や Qwen2.5-VL、Qwen3 などのオープンソース資産をベースにしつつ、PyTorch および FlashAttention を用いて最適化された推論処理を実現している。
- OTSL 形式による構造化出力: 表や数式を OTSL トークン列として直接生成し、後処理関数群によって標準的な HTML テーブルや LaTeX 形式へ確実に出力変換する設計を採用している。
4. 展望・課題(Next)
- コミュニティによるエコシステム拡大: GGUF 対応や llama.cpp 連携が進んでおり、今後は様々なハードウェアアクセラレータ上での最適化や実運用フィードバックを反映したバージョン更新が予定されている。