Cohere、文書解析モデル Parse 5 を公開──Markdown 変換精度で Mistral 超えと 95% のコスト削減を達成
2.3B パラメータの軽量ビジョンモデルで複雑な PDF をクリーンな Markdown に変換し、OCR コストを大幅に圧縮する。
リリース: 2026-08-27 · 読了 3 分記事の要約
1. 核心(What)
- Cohere が 2.3B パラメータのビジョン言語モデル Parse 5 を公開し、PDF やスライドを Markdown へ変換する機能を提供
- 価格設定は 1,000 ページあたり $1.50 で、LLM API や Azure Document Intelligence 比で最大 95% のコスト削減を実現
- ParseBench の 3 次元評価軸でスコア 79.2 を記録し、Mistral OCR 4(74.5)や Azure Document Intelligence(74.3)を上回る
- 対応言語は日本語を含む 9 言語で、HTML テーブルやバウンディング座標付きの Markdown を出力
2. 影響(Why)
- 数百万ページ級 RAG の運用コストを劇的に下げる: 数百万ページのドキュメントを処理する大規模 RAG 基盤において、1 ページ $1.50 の単価は従来のフロントエンド LLM 依存の設計コストを根本から解消する。
- 国内金融・EC 系 SaaS の非構造化データ抽出コストの最適化: [国内 金融・EC SaaS 業種] のような膨大な請求書や規約 PDF を扱う開発チームは、高価な汎用 LLM による OCR パスを Parse 5 に置き換えることで、処理単価を 6 割以上削減できる。
3. 根拠・詳細(How)
- north-micro-vision-instruct アーキテクチャ: 4.6GB 相当の 2.3B パラメータモデルに 8K コンテキストウィンドウを組み合わせ、テキスト抽出とレイアウト構造化を同時に処理する。
- ParseBench 評価ベンチマーク仕様: 金融や政府などの実務文書約 2,000 ページを対象とした LlamaIndex のベンチマークのうち、テーブル・コンテンツ忠実度・セマンティックフォーマットの 3 次元サブセットで検証。
4. 展望・課題(Next)
- 既知の機能制限への対策: 信頼度スコアの出力や階層的見出しの検出、構造化 JSON 出力には未対応であるため、後続の LLM パスによる補完が必要となる。