table-extraction-scientific-datasets
收藏资源简介:
该数据集包含三个子集:PubTables(来自PubTables-Test数据集的子集,包含图像、XML边界框、PDF、HTML和JSON文件)、Table-arXiv(从arXiv预印本的LaTeX源文件合成生成,包含类似文件结构)和Table-BRGM(手动注释的法语和英语地质报告领域特定数据集,包含图像等文件),用于科学PDF文档中表格提取的基准测试。
This dataset comprises three subsets: PubTables, a subset derived from the PubTables-Test dataset that includes images, XML bounding boxes, PDF, HTML, and JSON files; Table-arXiv, synthesized from LaTeX source files of arXiv preprints and featuring a similar file structure; and Table-BRGM, a manually annotated domain-specific dataset for French and English geological reports that contains files such as images. This dataset is utilized for benchmarking table extraction from scientific PDF documents.
数据集概述
该数据集详情页面介绍了 Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents 项目,旨在从异构科学PDF文档中评估表格提取方法。
数据集
数据集可在 Hugging Face 上获取,包含以下四个子集:
- PubTables:PubTables-Test数据集子集,包含HTML表格真实标注。数据组成包括 42,942 张 JPG 页面图像、42,942 个 PASCAL VOC 格式的 XML 边界框文件、23,567 个源 PDF 文件、55,991 个 HTML 格式的表格文件、46,942 个 JSON 格式的词边界框文件。
- Table-arXiv:从arXiv预印本的LaTeX源文件合成生成的数据集,用于真实标注生成。数据组成包括 36,869 张 JPG 页面图像、5,327 个 PASCAL VOC 格式的 XML 边界框文件、2,488 个源 PDF 文件、6,441 个 HTML 格式的表格文件、40,261 个 JSON 格式的词边界框文件。
- Table-BRGM:手动标注的领域特定数据集,包含来自BRGM的法语和英语地质报告。数据组成包括 2,003 张 JPG 页面图像、251 个 PASCAL VOC 格式的 XML 边界框文件、26 个源 PDF 文件、346 个 HTML 格式的表格文件、2,003 个 JSON 格式的词边界框文件。
- ICDAR-2013:从 ICDAR-2013 竞赛手动校正的数据集,包含欧盟和美国政府的PDF报告。数据组成包括 238 张 JPG 页面图像、135 个 PASCAL VOC 格式的 XML 边界框文件、67 个源 PDF 文件、163 个 HTML 格式的表格文件、238 个 JSON 格式的词边界框文件。
模型
项目评估了多种基线模型和基于计算机视觉的预训练模型:
- Python库:Camelot、PyMuPDF、PDFPlumber、Grobid
- 基于计算机视觉的方法:Docling、TATR、VGT
- 通用视觉语言模型:Qwen2.5-VL、GPT-4.1、Gemini 2.5 Pro
- 专家视觉语言模型:TabPedia、GOT-OCR 2.0、MonkeyOCR
评估指标
项目使用以下指标评估表格提取性能:
- 表格检测:IoU 50% 下的精确率和召回率、期望精确率和期望召回率(IoU 变化)、平均精度、基于 D-ECE 的模型校准
- 表格结构识别:GriTS 拓扑和内容、TEDS
- 表格提取:IoU 50% 下按TSR指标加权的精确率和召回率
代码与使用
- 代码安装:详见
/docs/ENVIRONMENT.md文件 - 模型推理:运行
cd src/inference/ && bash inference.bash model_name dataset save_dir命令进行推理。model_name可选项包括cam、plum、pymu、doc、grobid、tatr、xy、vgt、pedia、got、monkey、gpt、gemini、qwen、mathpix;dataset可选项包括pub、arx、brgm、icdar。输出为 JSON 文件,键为图像名称,值为包含html、boxes和scores的字典。更多细节见/docs/INFERENCE.md文件。 - 评估:运行
./src/evaluation/run_eval.sh model_name dataset pred_dir evaluation_type save_dir命令计算表格提取模型的指标。更多细节见/docs/EVALUATION.md文件。
引用
如引用此工作,请使用以下 BibTeX 条目:
@misc{soric2025benchmarkingtableextractionheterogeneous, title={Benchmarking Table Extraction from Heterogeneous Scientific Extraction Documents}, author={Marijan Soric and Cécile Gracianne and Ioana Manolescu and Pierre Senellart}, year={2025}, eprint={2511.16134}, archivePrefix={arXiv}, primaryClass={cs.DB}, url={https://arxiv.org/abs/2511.16134}, }




