登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ML Research pdf2img
ML Research pdf2img
收藏
Zenodo
2023-02-18 更新
2026-04-07 收录
文档图像转换
文献处理
数据链接:
https://zenodo.org/record/7653457
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Machine Learning related papers: pdf2img Used at https://github.com/stepp1/research-app/
应用场景:
提供机构:
U.Chile
创建时间:
2023-02-18
相关数据集
ReadingTimeMachine/rtm-sgt-ocr-v1
光学字符识别
文献处理
该数据集包含超过150万对合成的真实句子(SGT)与OCR句子对,用于OCR后校正任务。这些句子对是从arXiv批量下载的源文档中挖掘的,并使用Tesseract OCR引擎从编译的源文档生成的PDF页面中生成的OCR句子。数据集中的句子对来自1991-2011年的天文学文章,且未对任何PDF文档进行页面增强处理(即这些页面是‘干净’的,没有扭曲、灰尘等)。
Hugging Face
2025-07-07 更新
24
0
Vedavani-Dataset
语音识别
文献处理
Vedavani是一个针对吠陀梵语诗歌的自动语音识别(ASR)的基准数据集,包含来自《梨俱吠陀》和《阿闼婆吠陀》的丰富注释诗节,具有独特的韵律结构、语音复杂性和吟唱风格。
Hugging Face
2025-08-09 更新
14
0
mteb/arena-arxiv-7-2-24
文本嵌入模型基准测试
文献处理
`mteb/arena-arxiv-7-2-24`数据集是一个包含截至2024年7月2日ArXiv科学论文的全面集合,专为MTEB(大规模文本嵌入基准)竞技场设计,用于训练和评估嵌入模型。每个实例代表一篇ArXiv论文,包含唯一标识符、标题、摘要和类别。该数据集可用于训练新的嵌入模型、评估现有模型在科学文献上的表现,以及进行主题建模、文档分类或信息检索研究。
Hugging Face
2024-07-29 更新
13
0
SurveySum
文档摘要
文献处理
SurveySum数据集由数字经济研究所创建,旨在解决特定领域内多文档摘要工具的缺乏问题。该数据集包含79个部分,每个部分关联平均7.38篇科学文章,通过人工和自动方法从现有调查中提取和验证。数据集的创建过程涉及从科学文献中选择调查,提取文本和引用,并通过API和爬虫获取全文。SurveySum数据集主要应用于科学调查文本的自动生成,旨在提高科学文献处理的效率和准确性。
arXiv
2024-08-29 更新
17
0
laion/biorXiv-pdf
生物学文本挖掘
文献处理
BiorXiv PDF数据集是一个从BiorXiv网站收集的PDF文档集合,旨在为研究人员提供易于获取的训练数据集,以促进人工智能研究的民主化。该数据集包含生物及相关学科领域的预印本文章,由冷泉港实验室(CSHL)和扎克伯格·陈计划运营。预计研究人员和爱好者将使用这个数据集来训练和开发开创性的科学领域特定模型,以及为特定体裁和应用微调现有模型。
Hugging Face
2024-10-18 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广