登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
alaperna/PubTabNet_Validation
alaperna/PubTabNet_Validation
收藏
Hugging Face
2025-04-10 更新
2025-04-12 收录
表格结构识别
文档图像分析
数据链接:
https://hf-mirror.com/datasets/alaperna/PubTabNet_Validation
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cdla-permissive-1.0 ---
许可证:CDLA 宽松许可1.0版(CDLA-Permissive-1.0)
应用场景:
提供机构:
alaperna
相关数据集
ds4sd/FinTabNet_OTSL
表格结构识别
数据处理
该数据集是原始FinTabNet数据集的转换版本,采用了我们在论文《Optimized Table Tokenization for Table Structure Recognition》中提出的OTSL格式。数据集包括原始注释以及新添加的内容,如单元格内容、OTSL格式、HTML结构等。数据集的结构包括单元格、OTSL、HTML、恢复的HTML、列数、行数和图像。OTSL词汇表定义了新的表格结
Hugging Face
2023-08-31 更新
392
0
upstage/dp-bench
文档分析
表格结构识别
DP-Bench是一个文档解析基准数据集,旨在评估文档解析器的性能。它包含了从图书馆、开放教育资源和内部文档中收集的多种类型的文档样本。数据集将文档划分为12种布局元素类型,采用JSON格式存储,并提供了用于评估解析器性能的三个关键指标:NID(归一化插入删除距离)、TEDS(基于树编辑距离的相似性)和TEDS-S(基于树编辑距离的结构相似性)。
Hugging Face
2026-04-22 更新
15
0
dh-unibe/kurrent-hanse-xvi-test-lines-with-evaluation
手写文本识别
文档图像分析
该数据集名为evaluation-hf-printed,是基于danameyer/evaluation-hf-printed数据集并经过推理结果增强的版本。它包含164个样本,仅用于测试分割。数据集主要用于图像到文本转换、手写文本识别(HTR)和TrOCR模型的推理评估。数据特征包括项目名称、文件名、区域ID、行ID、行增强信息、图像、文本、行阅读顺序、行坐标、行基线、区域阅读顺序、区域类型、区域
Hugging Face
2026-06-05 更新
4
0
bsmock/ICDAR-2013.c
表格结构识别
数据集修正
ICDAR-2013.c数据集于2023年发布,是原始ICDAR-2013数据集的一个分支,由不同作者进行了修改。该数据集包含对原始数据集中小错误的修正,以及自动修正(如规范化),以纠正过度分割并使数据集与其他表格结构识别(TSR)数据集(如PubTables-1M)更加一致。更多关于此版本数据集和手动修正的详细信息,请参阅相关论文。
Hugging Face
2023-09-07 更新
155
0
table-extraction-scientific-datasets
科学文档表格提取
表格结构识别
该数据集包含三个子集:PubTables(来自PubTables-Test数据集的子集,包含图像、XML边界框、PDF、HTML和JSON文件)、Table-arXiv(从arXiv预印本的LaTeX源文件合成生成,包含类似文件结构)和Table-BRGM(手动注释的法语和英语地质报告领域特定数据集,包含图像等文件),用于科学PDF文档中表格提取的基准测试。
github
2026-06-01 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广