five

ArxivPapers

收藏
魔搭社区2025-11-28 更新2024-08-31 收录
下载链接:
https://modelscope.cn/datasets/OmniData/ArxivPapers
下载链接
链接失效反馈
官方服务:
资源简介:
displayName: ArxivPapers license: - Apache 2.0 mediaTypes: - Text paperUrl: https://arxiv.org/pdf/2004.14356v1.pdf publishDate: "2020" publishUrl: https://github.com/paperswithcode/axcell publisher: - DeepMind - University College London - Facebook tags: - Thesis taskTypes: - Text Mining - Text Information Extraction --- # 数据集介绍 ## 简介 ArxivPapers 数据集是 2007 年至 2020 年间在 arXiv.org 上发表的超过 104K 篇与机器学习相关的未标记论文集合。该数据集包括大约 94K 篇论文(可以使用 LaTeX 源代码),这些论文采用结构化形式,其中论文分为标题、摘要、部分、段落和参考文献。此外,该数据集包含从 LaTeX 论文中提取的超过 277K 表。 由于论文许可,数据集作为元数据和开源管道发布,可用于获取和转换论文。 ## 引文 ``` @article{kardas2020axcell, title={Axcell: Automatic extraction of results from machine learning papers}, author={Kardas, Marcin and Czapla, Piotr and Stenetorp, Pontus and Ruder, Sebastian and Riedel, Sebastian and Taylor, Ross and Stojnic, Robert}, journal={arXiv preprint arXiv:2004.14356}, year={2020} } ``` ## Download dataset :modelscope-code[]{type="git"}

displayName: 显示名称:ArxivPapers license: 许可协议:Apache 2.0 mediaTypes: 媒体类型:文本(Text) paperUrl: 论文链接:https://arxiv.org/pdf/2004.14356v1.pdf publishDate: 发布日期:"2020" publishUrl: 发布平台链接:https://github.com/paperswithcode/axcell publisher: 发布机构:DeepMind、伦敦大学学院(University College London)、Facebook tags: 标签:学位论文(Thesis) taskTypes: 任务类型:文本挖掘(Text Mining)、文本信息抽取(Text Information Extraction) --- # 数据集介绍 ## 简介 ArxivPapers 数据集是2007年至2020年间arXiv.org平台上发布的超过10.4万篇机器学习相关未标注论文集合。该数据集包含约9.4万篇可获取LaTeX源代码的论文,采用结构化形式组织,涵盖论文标题、摘要、章节、段落及参考文献等模块。此外,数据集还包含从LaTeX格式论文中提取的超过27.7万张表格。 由于论文版权许可要求,本数据集以元数据及开源预处理管道的形式发布,用户可通过该管道获取并转换原始论文。 ## 引文 @article{kardas2020axcell, title={Axcell: 自动提取机器学习论文中的实验结果}, author={Kardas, Marcin and Czapla, Piotr and Stenetorp, Pontus and Ruder, Sebastian and Riedel, Sebastian and Taylor, Ross and Stojnic, Robert}, journal={arXiv预印本 arXiv:2004.14356}, year={2020} } ## 数据集下载 :modelscope-code[]{type="git"}
提供机构:
maas
创建时间:
2024-07-01
5,000+
优质数据集
54 个
任务类型
进入经典数据集
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

数据驱动未来

携手共赢发展

商业合作