arxiv-url-bench-hf
收藏资源简介:
该数据集旨在评估arXiv学术文献语料库中不同文档格式对URL提取的影响,支持大规模可重复性研究。数据集包含两个主要部分:1) 200篇论文的基准集:这是一个精心策划的子集,包含1992年至2024年间选出的200篇论文,每篇论文都成功转换为六种不同格式(LaTeX、HTML、XML、Markdown、TXT、PNG),并提供了2,420个总URL(2,338个唯一URL)的人工审核真实标签,用于细粒度的基准分析。2) 360k篇论文的纵向多格式语料库:这是一个大规模的平行语料库,时间跨度长达33年(1992-2024),包含364,744篇论文(每年约7,000篇),每篇论文都以五种核心文本格式(LaTeX、HTML、XML、Markdown、TXT)成功表示,并提供了从这五种格式中统一提取的URL数据。数据集适用于文本提取、文档解析、URL提取、PDF解析和可重复性研究等任务。完整语料库体积巨大,下载前需确保具备足够的存储空间和网络带宽。
This dataset aims to evaluate the impact of different document formats on URL extraction in the arXiv academic literature corpus, supporting large-scale reproducibility studies. It consists of two main parts: 1) A benchmark set of 200 papers: This is a curated subset of 200 papers selected from 1992 to 2024, each successfully converted into six different formats (LaTeX, HTML, XML, Markdown, TXT, PNG), with manually verified ground truth labels for 2,420 total URLs (2,338 unique URLs), enabling fine-grained benchmark analysis. 2) A longitudinal multi-format corpus of 360k papers: This is a large-scale parallel corpus spanning 33 years (1992-2024), containing 364,744 papers (approximately 7,000 per year), each represented in five core text formats (LaTeX, HTML, XML, Markdown, TXT), with URL data uniformly extracted from these formats. The dataset is suitable for tasks such as text extraction, document parsing, URL extraction, PDF parsing, and reproducibility research. The full corpus is large in size, requiring sufficient storage space and network bandwidth before downloading.
数据集概述
该数据集由两部分组成,旨在评估不同文档格式对 arXiv 论文中 URL 提取的覆盖差异,支持大规模可重复性研究。
1. 200 篇论文基准集 (Ground Truth)
- 时间跨度: 1992–2024 年(阶段 A:2016–24 年;阶段 B:1992–15 年)
- 初始抽样池: 6,090 篇 PDF(按年份和文档类型分层抽样)
- 最终验证池: 200 篇论文,包含全部 6 种格式(TEXT、LaTeX、XML、HTML、Markdown、PNG)
- 提取数据总量: 2,420 个 URL(2,338 个唯一 URL),经人工审核作为严格真实标准
2. 36 万论文纵向语料库
- 时间跨度: 1992–2024 年(33 年)
- 初始抽样池: 467,467 篇 PDF(每年最多 15,000 篇论文的分层随机样本)
- 最终共同池: 364,744 篇论文(每年约 7,000 篇)
- 提取数据总量: 基于 5 种文本格式的统一提取
数据集结构与文件
| 文件名 | 大小 | 描述 |
|---|---|---|
arxiv-url-bench-200.tar.gz |
~2.8 GB | 200 篇基准论文的原始文件(含不同格式变体) |
arxiv_extracted_unique_urls_all_200_superset.json |
~10 MB | 所有格式变体提取的 URL 注册表(含人工标注的真实标签) |
arxiv-multi-format-mini-corpus-360k.tar.gz |
~150 GB | 完整的 364,744 篇论文多格式同步共同池 |
arxiv_extracted_urls_5_formats_360k.json |
~690 MB | 从 36 万数据集中跨 5 种核心文本格式提取的所有 URL 输出 |
关键元数据
- 许可证: CC-BY-4.0
- 任务类别: 文本提取、文档解析
- 语言: 英语
- 标签: arxiv、科学文档、URL 提取、PDF 解析、可重复性、PDF、LaTeX、HTML、XML、Markdown、文本、PNG
- 规模: 100K–1M 篇论文




