StarDoc-AI、文書解析モデル TeleOCR を公開──1.2B パラメータで Gemini 3 Pro をベンチマークで凌駕
1.2B パラメータの軽量 VLM ながら OmniDocBench で 96.87 を記録し、歪んだカメラ撮影文書からテーブルや数式を高精度に直接抽出する。
リリース: 2026-09-26 · 読了 3 分記事の要約
1. 核心(What)
- StarDoc-AI が公開した TeleOCR は、デジタル PDF と歪んだカメラ撮影文書の両方を単一のチェックポイントで処理する。
- モデルのベースには Qwen2.5-VL が採用されており、パラメータ数は約 12 億(1.2B)である。
- OmniDocBench v1.6 で 96.87 を記録し、OvisOCR2、PaddleOCR-VL-1.6、MinerU2.5-Pro などの特化型モデルを上回った。
- テーブル構造のシリアライズには OTSL(Open Table Structure Language)を用い、数式は LaTeX 形式で出力する。
2. 影響(Why)
- 前処理パイプラインの単一化: パースペクティブ補正や領域検出、OCR、表抽出を別個に呼び出す従来の手法を排除し、1.2B モデル単体で完結するためシステム複雑性が激減する。
- ローカル軽量推論の実用性: 1.2B というコンパクトな規模により、社内 VPC や単一の安価な GPU インフラでセキュアかつ高スループットな文書解析基盤を構築できる。
3. 根拠・詳細(How)
- 幾何学認識とマルチノード合意投票: Multi-node Consensus Voting とジオメトリ認識モデリングを導入し、湾曲や傾きのある領域を追従する多点レイアウトポリゴンを画像から直接生成する。
- コンテンツ構造分離学習の採用: Content-Structure Decoupled Learning により、テキスト内容とページ構造を分離して学習し、複雑なレイアウトにおける構造的類似度(TEDS-S)を高めている。
4. 展望・課題(Next)
- エコシステム統合と実運用検証: Apache-2.0 の下で公開された GGUF 版も含め、既存の vLLM や SGLang 環境への組み込みとスループット検証が進められる。