arxiv-ai-ml-100k
收藏资源简介:
该数据集是从`Rendra8631/arxiv-papers`数据集中筛选出的99,999篇论文的分层子集,主要包含`cs.AI`、`cs.CV`、`cs.LG`和`stat.ML`等主题,且仅限于2023年至2025年提交的论文。数据集作为OCR基准测试的构建产物,旨在为下游基准测试语料库(栅格化页面图像)提供稳定且范围明确的PDF池。数据集内容包括`metadata.parquet`文件(包含每篇论文的元数据及衍生列)和按主题及提交年月分组的PDF文件。筛选和采样过程包括主题过滤、提交年份限制、版本去重以及分层随机抽样,最终各主题的论文数量分别为:`cs.AI` 11,788篇,`cs.CV` 43,616篇,`cs.LG` 39,599篇,`stat.ML` 4,996篇。数据集中的每篇论文均保留其作者选择的版权和许可(通常为Creative Commons),使用者需自行检查具体许可条款。数据集的构建基于特定源代码提交和构建管道,确保可重现性。
This dataset is a stratified subset of 99,999 papers curated from the `Rendra8631/arxiv-papers` dataset, primarily covering topics including `cs.AI`, `cs.CV`, `cs.LG`, and `stat.ML`, with all papers submitted between 2023 and 2025. Developed as an artifact for OCR benchmark construction, this dataset provides a stable, clearly defined pool of PDFs for downstream benchmark corpora consisting of rasterized page images. The dataset comprises a `metadata.parquet` file that stores metadata and derived columns for each individual paper, alongside PDF files grouped by their subject category and submission year and month. The curation and sampling workflow includes subject filtering, submission year restriction, version deduplication, and stratified random sampling. The final per-topic paper counts are: 11,788 for `cs.AI`, 43,616 for `cs.CV`, 39,599 for `cs.LG`, and 4,996 for `stat.ML`. Each paper retains the copyright and license chosen by its authors, typically Creative Commons licenses; users must independently verify the specific license terms for each work. This dataset was built using dedicated source code submissions and build pipelines to ensure full reproducibility.
数据集概述:obswork/arxiv-ai-ml-100k
数据集来源与性质
- 本数据集是源数据集
Rendra8631/arxiv-papers在特定修订版本 (a2c6afb51332d2744b46308df6917697582f8cd4) 下的一个分层子集。 - 数据集规模为 99,999 篇论文。
- 数据集构建目的是作为
modal-model-experiments/arxiv_mirror/中OCR基准测试的构建产物,旨在为下游基准测试语料库(栅格化的页面图像)提供一个稳定且范围明确的PDF池。
内容筛选标准
- 学科范围:筛选保留 arXiv 主要学科类别为
cs.AI、cs.CV、cs.LG和stat.ML的论文。 - 提交时间:仅包含提交年份在
2023年至2025年之间的论文。年份从 arXiv ID 的YYMM.NNNNN前缀推导,对于2007年以前旧格式ID则通过正则表达式解析submission_date字段回退判断。 - 版本去重:对于源元数据中存在多个版本(如
...v1,...v2)的论文,仅保留最新版本。
抽样方法
- 采用分层随机抽样,目标为每个类别抽取 25,000 篇论文,使用随机数生成器种子
numpy.random.default_rng(seed=20260416)。 - 若某个类别的可用论文少于 25,000 篇,则纳入所有论文;由此产生的总数量不足部分,从筛选后剩余的论文池中均匀补足。
- 最终各类别论文数量如下:
cs.AI: 11,788 篇cs.CV: 43,616 篇cs.LG: 39,599 篇stat.ML: 4,996 篇
数据集文件结构
metadata.parquet:包含 99,999 行数据,每行对应一篇论文。该文件继承了源数据集的模式,并新增了primary_code、submission_year和target_filename三个派生列。pdfs/<primary_code>/<YYMM>/<arxiv_id>.pdf:每篇论文对应一个PDF文件。文件按 arXiv 主要学科代码(例如cs.CV)和提交年月(YYMM格式)进行分桶存储。YYMM层级的设计旨在使每个目录下的文件数保持在 Hugging Face 平台要求的每目录10,000个文件上限以内,同时为使用者提供了按时间切片的自然维度。
许可信息
- 本数据集是来自 arXiv.org 的学术著作集合。每篇论文仍受其各自作者选定的版权和许可协议约束(通常为知识共享许可)。
- 数据使用者有责任检查其下载或重新分发的任何论文的具体许可条款。上游许可说明请参阅源数据集。
可复现性
- 源数据集提交版本:
a2c6afb51332d2744b46308df6917697582f8cd4。 - 构建流程脚本:
arxiv_mirror/{filter_plan,mirror,finalize}.py。




