LlamaIndex、構造化データ抽出ベンチマーク ExtractBench を HuggingFace で公開──370 業界文書と 5 軸タグで精度を評価
SEC 13F や医療レミッタンスなど 8 領域 370 ドキュメント(4,869 ページ)を網羅し、LLM の抽出エラーをタスク・長短の 5 軸で原因分解する。
リリース: 2026-07-31 · 読了 3 分記事の要約
1. 核心(What)
- LlamaIndex はユーザー定義スキーマと全文書を入力し、ソースページとバウンディングボックスの証拠付き JSON を返す評価フレームワーク ExtractBench を公開した。
- データセットには 8 つのビジネスドメイン、67 のドキュメントタイプからなる 370 ドキュメント、4,869 ページが含まれる。
- 評価項目として、長リストの網羅性(T1)、検索(T2)、高密度ドキュメント(T3)の 3 つのタスク課題が定義されている。
- 文書の長さは 3 つのバケット(短: L1、中: L2、長: L3)に分類され、多様なレイアウトのドキュメントをカバーしている。
2. 影響(Why)
- 失敗要因の構造的切り分け: 5 つの独立した軸でタグ付けされているため、スコア低下の原因が視覚的要因かタスク構造に起因するものかを直接特定できる。
- 実務文書ベースの評価: 単一の単純な帳票ではなく SEC 13F や不動産開示などの複雑な実務文書を含むため、商用 RAG の実運用に向けた耐性を測れる。
3. 根拠・詳細(How)
- 評価パイプラインとタグ体系: 評価フレームワークはシステムごと、スプリットごと、タグごとにスコアを集計し、抽出失敗(ハルシネーションや不完全なレコード)を各軸で定量化する。
4. 展望・課題(Next)
- 今後の活用展望: 多様な LLM やパーサを組み合わせた抽出パイプラインの比較検証、および追加ドキュメントタイプの拡充が予定されている。