🧠Research🔥🔥

Cohere、文書解析モデル Parse 5 を公開──Markdown 変換精度で Mistral 超えと 95% のコスト削減を達成

2.3B パラメータの軽量ビジョンモデルで複雑な PDF をクリーンな Markdown に変換し、OCR コストを大幅に圧縮する。
リリース: 2026-08-27 · 読了 3

記事の要約

1. 核心(What)

  • Cohere が 2.3B パラメータのビジョン言語モデル Parse 5 を公開し、PDF やスライドを Markdown へ変換する機能を提供
  • 価格設定は 1,000 ページあたり $1.50 で、LLM API や Azure Document Intelligence 比で最大 95% のコスト削減を実現
  • ParseBench の 3 次元評価軸でスコア 79.2 を記録し、Mistral OCR 4(74.5)や Azure Document Intelligence(74.3)を上回る
  • 対応言語は日本語を含む 9 言語で、HTML テーブルやバウンディング座標付きの Markdown を出力

2. 影響(Why)

  • 数百万ページ級 RAG の運用コストを劇的に下げる: 数百万ページのドキュメントを処理する大規模 RAG 基盤において、1 ページ $1.50 の単価は従来のフロントエンド LLM 依存の設計コストを根本から解消する。
  • 国内金融・EC 系 SaaS の非構造化データ抽出コストの最適化: [国内 金融・EC SaaS 業種] のような膨大な請求書や規約 PDF を扱う開発チームは、高価な汎用 LLM による OCR パスを Parse 5 に置き換えることで、処理単価を 6 割以上削減できる。

3. 根拠・詳細(How)

  • north-micro-vision-instruct アーキテクチャ: 4.6GB 相当の 2.3B パラメータモデルに 8K コンテキストウィンドウを組み合わせ、テキスト抽出とレイアウト構造化を同時に処理する。
  • ParseBench 評価ベンチマーク仕様: 金融や政府などの実務文書約 2,000 ページを対象とした LlamaIndex のベンチマークのうち、テーブル・コンテンツ忠実度・セマンティックフォーマットの 3 次元サブセットで検証。

4. 展望・課題(Next)

  • 既知の機能制限への対策: 信頼度スコアの出力や階層的見出しの検出、構造化 JSON 出力には未対応であるため、後続の LLM パスによる補完が必要となる。