登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Replication Data for: Preprocessed SynRD
Replication Data for: Preprocessed SynRD
收藏
Harvard Dataverse
2023-02-26 更新
2026-04-09 收录
文献处理
数据基准测试
数据链接:
https://dataverse.harvard.edu/citation?persistentId=doi:10.7910/DVN/YL22QK
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
These are preprocessed tsvs for each paper in the SynRD benchmark.
应用场景:
提供机构:
NYU
创建时间:
2023-01-01
相关数据集
ReadingTimeMachine/rtm-sgt-ocr-v1
光学字符识别
文献处理
该数据集包含超过150万对合成的真实句子(SGT)与OCR句子对,用于OCR后校正任务。这些句子对是从arXiv批量下载的源文档中挖掘的,并使用Tesseract OCR引擎从编译的源文档生成的PDF页面中生成的OCR句子。数据集中的句子对来自1991-2011年的天文学文章,且未对任何PDF文档进行页面增强处理(即这些页面是‘干净’的,没有扭曲、灰尘等)。
Hugging Face
2025-07-07 更新
24
0
pie/scidtb_argmin
文献处理
机器学习模型训练
SciDTB ArgMin数据集是一个用于论证挖掘的任务,包含了文档的tokens、id和metadata信息,并且标注了units和relations两个层面。units层面包括提案、断言、结果、观察、手段和描述等标签,而relations层面则包括支持、攻击、附加、细节和序列等关系标签。
Hugging Face
2025-09-24 更新
10
0
GNN Benchmarking Datasets
图神经网络评估
数据基准测试
Datasets appearing in "https://arxiv.org/abs/2003.00982" converted to HDF5
Zenodo
2021-09-11 更新
8
0
laion/biorXiv-pdf
生物学文本挖掘
文献处理
BiorXiv PDF数据集是一个从BiorXiv网站收集的PDF文档集合,旨在为研究人员提供易于获取的训练数据集,以促进人工智能研究的民主化。该数据集包含生物及相关学科领域的预印本文章,由冷泉港实验室(CSHL)和扎克伯格·陈计划运营。预计研究人员和爱好者将使用这个数据集来训练和开发开创性的科学领域特定模型,以及为特定体裁和应用微调现有模型。
Hugging Face
2024-10-18 更新
13
0
timaeus/dsir-pile-13m-filtered-for-philpapers
文本分析
文献处理
--- dataset_info: features: - name: contents dtype: string - name: metadata struct: - name: pile_set_name sequence: string - name: id dtype: int64 splits: - name: tra
Hugging Face
2024-11-15 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广