ArxivPapers
收藏OpenXLab2026-04-18 收录
下载链接:
https://openxlab.org.cn/datasets/OpenDataLab/ArxivPapers
下载链接
链接失效反馈官方服务:
资源简介:
ArxivPapers 数据集是 2007 年至 2020 年间在 arXiv.org 上发表的超过 104K 篇与机器学习相关的未标记论文集合。该数据集包括大约 94K 篇论文(可以使用 LaTeX 源代码),这些论文采用结构化形式,其中论文分为标题、摘要、部分、段落和参考文献。此外,该数据集包含从 LaTeX 论文中提取的超过 277K 表。
由于论文许可,数据集作为元数据和开源管道发布,可用于获取和转换论文。
提供机构:
OpenDataLab
创建时间:
2022-05-23



