🛠Tools🔥🔥

LlamaIndex、ドキュメント解析ルーター OpenDocRouter を公開──10種類の OCR モデルを単一 API で統合

Claude Opus 5.5 や MinerU など 10 のバックエンドを同一のリクエスト仕様で切り替え、ページ単位の課金とリトライ制御を可能にした。
リリース: 2026-10-07 · 読了 3 分

記事の要約

1. 核心(What)

  • LlamaIndex が 10 種類の文書解析モデルを単一の HTTP エンドポイントで束ねる OpenDocRouter を公開した。
  • リクエストにはベアラートークン、モデル ID、文書 URL、ページ範囲を指定し、共通の Markdown レスポンスを受け取る。
  • 各ページの処理は独立したステータスと課金を持ち、大規模 PDF での一部失敗時にも対象ページのみを再試行できる。
  • layout: true オプションを指定することで、バックエンド側のネイティブ対応に関わらず共通のバウンディングボックスとレイアウトクラスが付与される。

2. 影響(Why)

  • モデル検証コストの圧縮: ParseBench による共通評価スコアと同一のリクエスト仕様により、各モデルの出力品質とコストの比較検証を短期間で実施できる。
  • ページ単位の障害耐性: ドキュメント全体を再実行せず、失敗したページだけを狙ってリトライできるため大規模バッチ処理の無駄なコストを防ぐ。

3. 根拠・詳細(How)

  • 統一されたリクエスト仕様: TypeScript SDK (@llamaindex/opendocrouter) および Python SDK が提供され、モデル ID の文字列を書き換えるだけでバックエンドを切り替え可能。
  • 独立したページごとの非同期実行: 各ページを個別コールとしてスケジューリングし、個別ステータスと課金を適用するアーキテクチャを採用している。

4. 展望・課題(Next)

  • クロスボーダー課題の検証: ページをまたぐ表の継続やヘッダーの繰り返しなど、ページ分割処理がダウンストリームの構造理解に与える影響の評価が必要となる。