secemp9、arXiv 全文・メタデータ統合データセット arxiv-complete を公開──310 万報超の TeX と PDF を収録
arXiv のメタデータ、バージョン履歴、TeX ソース、PDF を 16.08 TB の Parquet 形式で網羅し、大規模な学術 RAG や事前学習用コーパスの構築を効率化する。
リリース: 2024-03-04 · 読了 3 分記事の要約
1. 核心(What)
- 総計 3,148,796 報の論文を網羅し、ファイルサイズや SHA-256 ダイジェストを含むメタデータを提供する。
- 全 9 つの Parquet 構成の合計容量は 16.08 TB に達し、PDF は 10.37 TB の生データを含んで構成される。
- PDF の保持率は有効な非ゼロサイズの論文に対して 99.47%、バージョン単位では 99.54% を達成している。
- データセットは HuggingFace 上で公開され、26 MB のサンプルや個別の parquet 構成を load_dataset で取得できる。
2. 影響(Why)
- 前処理コストの圧倒的削減: 数百万件の論文 PDF や TeX ソースを自前でクローリング・パースする数カ月分のエンジニアリング工数を、Parquet 形式の標準データセットを利用することで即座に回避できる。
- 国内学術 RAG 開発への直結: 論文検索の精度を競う国内の AI ベンダーや研究組織は、欠損値やハッシュ値が検証済みのクリーンなコーパスをベースラインとして利用し、評価実験の再現性を担保できる。
3. 根拠・詳細(How)
- 多様なデータ形式のマルチコンフィグ構造: メタデータ、latex、source、pdf、ps の各コンフィグが Parquet 形式で分離され、リモート SQL クエリによって必要なカラムや行グループのみをダウンロードせずに射影・検証できる。
- 効率的なハブからの部分取得設計: snapshot_download() の allow_patterns を利用し、16 TB 全体のダウンロードを避け、paper_text などの特定インデックスのみを選択して 4.35 GB の軽量な構成から検証を開始できる。
4. 展望・課題(Next)
- 2026年移行分の補完と検証: 2026 年以降に発生している未取得分のギャップや古いプレプリントの 404 エラーに対し、arXiv の最新のアクセス規約に沿った追加のフェッチ作業が求められる。