ArxivPapers
收藏魔搭社区2025-11-28 更新2024-08-31 收录
下载链接:
https://modelscope.cn/datasets/OmniData/ArxivPapers
下载链接
链接失效反馈官方服务:
资源简介:
displayName: ArxivPapers
license:
- Apache 2.0
mediaTypes:
- Text
paperUrl: https://arxiv.org/pdf/2004.14356v1.pdf
publishDate: "2020"
publishUrl: https://github.com/paperswithcode/axcell
publisher:
- DeepMind
- University College London
- Facebook
tags:
- Thesis
taskTypes:
- Text Mining
- Text Information Extraction
---
# 数据集介绍
## 简介
ArxivPapers 数据集是 2007 年至 2020 年间在 arXiv.org 上发表的超过 104K 篇与机器学习相关的未标记论文集合。该数据集包括大约 94K 篇论文(可以使用 LaTeX 源代码),这些论文采用结构化形式,其中论文分为标题、摘要、部分、段落和参考文献。此外,该数据集包含从 LaTeX 论文中提取的超过 277K 表。
由于论文许可,数据集作为元数据和开源管道发布,可用于获取和转换论文。
## 引文
```
@article{kardas2020axcell,
title={Axcell: Automatic extraction of results from machine learning papers},
author={Kardas, Marcin and Czapla, Piotr and Stenetorp, Pontus and Ruder, Sebastian and Riedel, Sebastian and Taylor, Ross and Stojnic, Robert},
journal={arXiv preprint arXiv:2004.14356},
year={2020}
}
```
## Download dataset
:modelscope-code[]{type="git"}
displayName: 显示名称:ArxivPapers
license: 许可协议:Apache 2.0
mediaTypes: 媒体类型:文本(Text)
paperUrl: 论文链接:https://arxiv.org/pdf/2004.14356v1.pdf
publishDate: 发布日期:"2020"
publishUrl: 发布平台链接:https://github.com/paperswithcode/axcell
publisher: 发布机构:DeepMind、伦敦大学学院(University College London)、Facebook
tags: 标签:学位论文(Thesis)
taskTypes: 任务类型:文本挖掘(Text Mining)、文本信息抽取(Text Information Extraction)
---
# 数据集介绍
## 简介
ArxivPapers 数据集是2007年至2020年间arXiv.org平台上发布的超过10.4万篇机器学习相关未标注论文集合。该数据集包含约9.4万篇可获取LaTeX源代码的论文,采用结构化形式组织,涵盖论文标题、摘要、章节、段落及参考文献等模块。此外,数据集还包含从LaTeX格式论文中提取的超过27.7万张表格。
由于论文版权许可要求,本数据集以元数据及开源预处理管道的形式发布,用户可通过该管道获取并转换原始论文。
## 引文
@article{kardas2020axcell,
title={Axcell: 自动提取机器学习论文中的实验结果},
author={Kardas, Marcin and Czapla, Piotr and Stenetorp, Pontus and Ruder, Sebastian and Riedel, Sebastian and Taylor, Ross and Stojnic, Robert},
journal={arXiv预印本 arXiv:2004.14356},
year={2020}
}
## 数据集下载
:modelscope-code[]{type="git"}
提供机构:
maas
创建时间:
2024-07-01



