遇见数据集

table-extraction-scientific-datasets

收藏
github2026-06-01 更新2026-06-06 收录
官方服务:

资源简介:

该数据集包含三个子集:PubTables(来自PubTables-Test数据集的子集,包含图像、XML边界框、PDF、HTML和JSON文件)、Table-arXiv(从arXiv预印本的LaTeX源文件合成生成,包含类似文件结构)和Table-BRGM(手动注释的法语和英语地质报告领域特定数据集,包含图像等文件),用于科学PDF文档中表格提取的基准测试。

This dataset comprises three subsets: PubTables, a subset derived from the PubTables-Test dataset that includes images, XML bounding boxes, PDF, HTML, and JSON files; Table-arXiv, synthesized from LaTeX source files of arXiv preprints and featuring a similar file structure; and Table-BRGM, a manually annotated domain-specific dataset for French and English geological reports that contains files such as images. This dataset is utilized for benchmarking table extraction from scientific PDF documents.

创建时间:
2026-05-30
原始信息汇总

数据集概述

该数据集详情页面介绍了 Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents 项目,旨在从异构科学PDF文档中评估表格提取方法。

数据集

数据集可在 Hugging Face 上获取,包含以下四个子集:

  • PubTables:PubTables-Test数据集子集,包含HTML表格真实标注。数据组成包括 42,942 张 JPG 页面图像、42,942 个 PASCAL VOC 格式的 XML 边界框文件、23,567 个源 PDF 文件、55,991 个 HTML 格式的表格文件、46,942 个 JSON 格式的词边界框文件。
  • Table-arXiv:从arXiv预印本的LaTeX源文件合成生成的数据集,用于真实标注生成。数据组成包括 36,869 张 JPG 页面图像、5,327 个 PASCAL VOC 格式的 XML 边界框文件、2,488 个源 PDF 文件、6,441 个 HTML 格式的表格文件、40,261 个 JSON 格式的词边界框文件。
  • Table-BRGM:手动标注的领域特定数据集,包含来自BRGM的法语和英语地质报告。数据组成包括 2,003 张 JPG 页面图像、251 个 PASCAL VOC 格式的 XML 边界框文件、26 个源 PDF 文件、346 个 HTML 格式的表格文件、2,003 个 JSON 格式的词边界框文件。
  • ICDAR-2013:从 ICDAR-2013 竞赛手动校正的数据集,包含欧盟和美国政府的PDF报告。数据组成包括 238 张 JPG 页面图像、135 个 PASCAL VOC 格式的 XML 边界框文件、67 个源 PDF 文件、163 个 HTML 格式的表格文件、238 个 JSON 格式的词边界框文件。

模型

项目评估了多种基线模型和基于计算机视觉的预训练模型:

  • Python库:Camelot、PyMuPDF、PDFPlumber、Grobid
  • 基于计算机视觉的方法:Docling、TATR、VGT
  • 通用视觉语言模型:Qwen2.5-VL、GPT-4.1、Gemini 2.5 Pro
  • 专家视觉语言模型:TabPedia、GOT-OCR 2.0、MonkeyOCR

评估指标

项目使用以下指标评估表格提取性能:

  • 表格检测:IoU 50% 下的精确率和召回率、期望精确率和期望召回率(IoU 变化)、平均精度、基于 D-ECE 的模型校准
  • 表格结构识别:GriTS 拓扑和内容、TEDS
  • 表格提取:IoU 50% 下按TSR指标加权的精确率和召回率

代码与使用

  • 代码安装:详见 /docs/ENVIRONMENT.md 文件
  • 模型推理:运行 cd src/inference/ && bash inference.bash model_name dataset save_dir 命令进行推理。model_name 可选项包括 camplumpymudocgrobidtatrxyvgtpediagotmonkeygptgeminiqwenmathpixdataset 可选项包括 pubarxbrgmicdar。输出为 JSON 文件,键为图像名称,值为包含 htmlboxesscores 的字典。更多细节见 /docs/INFERENCE.md 文件。
  • 评估:运行 ./src/evaluation/run_eval.sh model_name dataset pred_dir evaluation_type save_dir 命令计算表格提取模型的指标。更多细节见 /docs/EVALUATION.md 文件。

引用

如引用此工作,请使用以下 BibTeX 条目:

@misc{soric2025benchmarkingtableextractionheterogeneous, title={Benchmarking Table Extraction from Heterogeneous Scientific Extraction Documents}, author={Marijan Soric and Cécile Gracianne and Ioana Manolescu and Pierre Senellart}, year={2025}, eprint={2511.16134}, archivePrefix={arXiv}, primaryClass={cs.DB}, url={https://arxiv.org/abs/2511.16134}, }

搜集汇总
数据集介绍
table-extraction-scientific-datasets 数据集图片
构建方式
该数据集专为评估异构科学PDF文档中的表格提取任务而构建,整合了四大子数据集。其中,PubTables源自PubMed Central的公开文献,并额外补充了HTML格式的表格标注信息;Table-arXiv则通过从arXiv预印本的LaTeX源码中合成生成,确保了标注的精确性;Table-BRGM聚焦于法国地质与矿产调查局(BRGM)的法语及英语地质报告,经由人工精细标注而成,领域特征鲜明;ICDAR-2013数据集在原有国际竞赛标注基础上进行了人工修正,内容涵盖欧盟与美国政府的PDF报告。所有子集均统一提供了页面图像、PASCAL VOC格式的边界框XML文件、原始PDF、HTML标记的表格内容以及词级令牌位置的JSON文件,为多维度评估奠定了坚实基础。
使用方法
使用方法便捷且高度模块化。用户可通过Hugging Face平台直接下载完整的图像、标注及PDF文件,并依据开源代码库中的详细指南配置运行环境。进行模型推理时,在`src/inference/`目录下执行`inference.bash`脚本,并指定模型名称(如`tatr`、`gpt`)、数据集代号(如`pub`、`brgm`)及输出路径即可。评估阶段则通过`run_eval.sh`脚本一键计算表格检测、结构识别与完整提取任务中的精确率、召回率及GriTS等多项指标。这种简洁的设计使得研究者能够快速复现论文实验,或轻松引入新模型以扩展基准测试。
背景与挑战
背景概述
在科学文献中,表格作为高度凝练的数据载体,承载着实验结论、统计结果等核心信息。然而,异构性PDF文档中的表格结构千差万别,缺乏统一提取标准,制约了大规模知识挖掘的进程。为此,Marijan Soric、Cécile Gracianne等来自法国国家信息与自动化研究所(Inria)的研究人员,于2025年创建了该基准数据集,旨在系统评估从多样化学术PDF中提取表格的能力。该研究以独特的四维数据集构成(覆盖生物医学预印本、多学科学术论文、法国地质调查局专业报告及国际竞赛数据),为表格检测与结构识别提供了跨领域、跨语种的基准测试,有力推动了文档理解领域的标准化评估。
当前挑战
该数据集面临的挑战主要体现在双重维度:一方面,领域问题本身具有高难度,表格边界模糊、跨页断裂、复杂合并单元格及图文混合排版等现象普遍存在,传统规则与单一模型难以通用化;另一方面,数据集构建过程亦充满艰辛,需从PubTables等大规模源中精准提取并转换为HTML标注格式,并为Table-BRGM等专业领域数据手工标注数万张图像,平衡不同数据集间的标注粒度与格式一致性。此外,评估指标多样(如GriTS、TEDS与加权召回率)导致模型对比复杂,且合成数据集(如Table-arXiv)与真实手工标注数据间的领域偏移,对模型泛化性构成了严峻考验。
常用场景
经典使用场景
在学术文献日益电子化的背景下,科学PDF文档中的表格信息承载着关键实验数据与统计结果,然而其异构性与复杂排版使得自动化提取成为长期挑战。该数据集整合了来自PubMed Central的PubTables、arXiv预印本的Table-arXiv、法国BRGM地质报告及ICDAR-2013竞赛语料,覆盖生物医学、物理学、地球科学等多学科领域。其最经典的使用场景是作为统一基准,评估从结构化表格到复杂嵌套布局的检测与识别能力。研究者通过提供的页面图像、边界框标注及HTML格式真实值,可系统性地训练并测试表格检测、结构识别与端到端提取模型的性能,从而在受控条件下衡量算法对多源异构PDF文档的泛化鲁棒性。
解决学术问题
该数据集精准回应了学术界长期面临的科学文档表格提取评估碎片化问题。此前缺乏涵盖多领域、多格式且标注完备的公共基准,导致模型性能对比难以公正且缺乏可复现性。数据集通过提供跨生物医学、物理学、地学等领域的统一标注语料,并引入从表格检测到结构识别再到端到端提取的多层级评估协议,使研究者得以系统量化不同方法在面对字体变体、多栏混合、跨页表格等复杂情境时的表现。此举不仅弥合了现有基准在领域多样性与注释深度上的鸿沟,更推动了该领域从经验性摸索向可衡量、可比较的科学范式迈进,深刻影响了后续算法设计的评价标准。
实际应用
在科研信息管理与数字图书馆工程中,该数据集催生了切实可行的技术方案。例如,出版机构可利用基于此基准训练的高精度表格提取系统,将海量历史PDF文档中的实验结果与统计表格自动转化为结构化数据,存入数据库供全文检索与元数据关联。科研平台亦可借此构建知识图谱,从跨领域文献中抽提实验比对、参数值等关键实体关系,赋能科研人员快速获取系统综述所需证据。此外,在开放科学运动中,该技术被应用于自动构建可计算的科学数据集,支持机器学习模型的训练数据从静态论文中自主生成,极大降低了人工数据编制成本,提升了科学发现的效率与广度。
数据集最近研究
最新研究方向
在科学文献数字化进程中,表格作为承载结构化信息的关键要素,其自动提取技术正面临异构PDF文档带来的严峻挑战。该数据集聚焦于评测从不同排版风格和领域来源的科学PDF中精准检测与解析表格的能力,尤其关注地质报告、arXiv预印本等多样化场景。伴随大语言模型与视觉-语言模型(如Qwen2.5-VL、GPT-4.1)的崛起,研究热点已从传统的基于规则或卷积神经网络的检测方法,转向探索通用VLM、专家VLM及端到端表格解析框架的综合效能。这一方向不仅推动了文档智能领域评测标准的演进,更对学术知识库构建、科学数据自动归档及跨领域信息抽取具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务