遇见数据集

awesome-table-structure-recognition

收藏
github2026-05-08 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于表格结构识别(TSR)研究的精选数据集合集,涵盖了多个流行的数据集,如ICDAR2013、SciTSR、TableBank、PubTabNet、PubTables-1M、FinbTabNet、WTW、SynthTabNet、TabRecSet和iFLYTAB等。这些数据集主要包含数字或混合类型的数据,用于表格检测、表格结构识别和表格内容识别等任务,时间跨度从2013年到2023年。该合集以表格形式组织,提供了每个数据集的名称、表格数量、数据类型、支持的任务和发布年份等信息。

This is a curated dataset collection for Table Structure Recognition (TSR) research, covering multiple popular datasets such as ICDAR2013, SciTSR, TableBank, PubTabNet, PubTables-1M, FinbTabNet, WTW, SynthTabNet, TabRecSet, and iFLYTAB. These datasets mainly contain numerical or mixed-type data, and are used for tasks including table detection, table structure recognition and table content recognition, spanning from 2013 to 2023. This collection is organized in a tabular format, providing information such as the name, number of tables, data type, supported tasks and release year of each dataset.

创建时间:
2023-12-15
原始信息汇总

数据集概览

该页面是一个关于表格结构识别(Table Structure Recognition, TSR) 研究资源的精选列表,涵盖了流行数据集、SOTA模型、重要论文及开源代码,并持续更新。

主流数据集

列表包含11个用于表格检测、结构识别和内容识别的数据集,详细信息如下:

数据集名称 表格数量 数据类型 表格检测 (TD) 表格结构识别 (TSR) 表格内容识别 (TCR) 发布年份
ICDAR2013 156 数字文档 2013
SciTSR 15K 数字文档 × 2019
TableBank 417K 数字文档 × × 2020
TableBank 145K 数字文档 × × 2020
PubTabNet 1M+ 数字文档 × 2020
PubTables-1M 1M+ 数字文档 × 2021
FinbTabNet 91,596 数字文档 × 2021
WTW 14,581 数字/实体 × × 2021
SynthTabNet 600K 数字文档 × 2022
TabRecSet 38,177 数字/实体 2023
iFLYTAB 12,104 数字/实体 × 2023

注:

  • TD:表格检测 (Table Detection)
  • TSR:表格结构识别 (Table Structure Recognition)
  • TCD:表格内容识别 (Table Content Recognition)
  • Both:同时包含数字文档和实体文档数据

SOTA模型

页面按方法类型列出了截至2024年的SOTA模型,包括其引用次数、发布年份、会议/期刊及开源情况。

1. 自底向上方法 (Bottom-up)

  • 2019:Res2TIM (ICDAR)
  • 2020:CascadeTabNet (CVPR), TabStruct-Net (ECCV)
  • 2021:LGPMA (ICDAR), Cycle-CenterNet (ICCV), TGRNet (ICCV), FLAG-NET (MM), GTE (WACV)
  • 2022:NCGM (CVPR)
  • 2023:LORE (AAAI)

2. 图像到标记语言方法 (Image2Markup)

  • 2020:EDD (ECCV)
  • 2021:TableMaster (ICDAR)
  • 2022:TableFormer (CVPR)
  • 2023:VAST (CVPR)
  • 2024:UniTable, OminParser (CVPR)

3. 分割与合并方法 (Split-and-Merge Based)

  • 2019:SPLERGE (ICDAR)
  • 2022:SEM (PR), TSRFormer (MM)
  • 2023:RobusTabNet (PR)
  • 2024:SEMv2 (PR), TSRFormer-DQ-DETR (PR)

4. 其他方法 (Others)

  • 2019:TableNet (ICDAR)
  • 2022:DETR (CVPR)
  • 2023:TRACE (ICDAR)

重要论文

页面按发表年份和会议/期刊整理了重要论文,例如:

  • CVPR 2024:OmniParser
  • PR 2024:SEMv2, Robust table structure recognition with dynamic queries enhanced detection transformer
  • CVPR 2023:Improving Table Structure Recognition with Visual-Alignment Sequential Coordinate Modeling
  • AAAI 2023:LORE
  • ACL 2023:TableVLM
  • CVPR 2022:NCGM, TableFormer, PubTables-1M
  • ICCV 2021:Parsing Table Structures in the Wild, TGRNet
  • ECCV 2020:Image-based table recognition: data, model, and evaluation, Table Structure Recognition using Top-Down and Bottom-Up Cues

其他资源

  • 2024:UniTable
  • 2023:TabRecSet (A large-scale dataset for end-to-end table recognition in the wild)
  • 2021:Multi-Type-TD-TSR
  • 综述 (Surveys)
    • ICDAR 2023:A Study on Reproducibility and Replicability of Table Structure Recognition Methods
    • Deep Learning for Table Detection and Structure Recognition: A Survey
搜集汇总
数据集介绍
awesome-table-structure-recognition 数据集图片
构建方式
在文档智能与表格理解领域,表格结构识别(TSR)作为一项核心任务,旨在从图像或数字文档中解析表格的物理布局与逻辑结构。该数据集以系统性综述为构建理念,通过广泛检索顶级学术会议(如CVPR、ICDAR、AAAI)与权威期刊(如PR)中的相关文献,精心筛选并整合了涵盖自2019年以来的前沿研究成果。其构建过程遵循严格的学术标准,不仅收录了具有代表性的基准数据集(如PubTabNet、PubTables-1M),还囊括了多种方法类型的SOTA模型,包括自底向上、图像到标记以及分割合并等范式,形成了一套全面且层次分明的知识体系。
使用方法
研究者可通过该数据集的层级索引高效定位所需资源。对于入门者,可优先参考“Popular Datasets”部分,依据任务需求(如仅需结构识别或需联合内容识别)选择如SciTSR或SynthTabNet等合适的数据集进行实验。进阶用户则可从“SOTA Models”中选取对应方法类型的开源代码(如CascadeTabNet或SEMv2),直接复现论文结果或进行性能对比。同时,数据集收录的综述论文为系统性理解领域挑战提供了理论支撑,而Star History图表则直观反映了社区关注度的动态变化。
背景与挑战
背景概述
表格结构识别(Table Structure Recognition, TSR)作为文档分析与理解领域的关键任务,旨在从图像或数字化文档中自动解析表格的布局结构,包括行、列、单元格的划分与合并关系。随着深度学习的蓬勃发展,TSR技术从早期的基于规则与启发式方法逐步演进至数据驱动的端到端模型,其研究热度自2019年以来显著攀升,催生了诸如ICDAR、CVPR、ECCV等顶级会议上的大量创新成果。该数据集资源列表由社区维护,系统性收录了从2013年ICDAR2013基准到2024年UniTable、OmniParser等前沿模型的代表性工作,覆盖了自底向上、图像到标记语言及分割合并等多种技术路线。其核心研究问题聚焦于如何在海量、异质的文档图像中实现高精度、鲁棒的表格结构解析,对推动文档智能、信息抽取及知识图谱构建等领域具有深远影响。
当前挑战
当前TSR领域面临的核心挑战首先在于表格形态的极端多样性:从简单的数字表格到复杂的跨行跨列、嵌套结构,乃至包含旋转、弯曲等非标准布局的表格,对模型的泛化能力构成严峻考验。其次,真实场景中的表格常与文本、图片等元素交错,且存在光照不均、模糊、遮挡等图像退化问题,使得表格检测与结构识别易受干扰。在数据集构建层面,人工标注大规模、高精度的表格结构(如单元格边界、合并关系)成本高昂且易产生歧义,现有数据集如PubTabNet、TabRecSet虽具规模,但多聚焦于特定类型(如科学文献、财务报表),缺乏对自然场景表格的充分覆盖。此外,不同数据集在标注粒度与格式上的不一致性,也增加了模型评估与跨域迁移的复杂性。
常用场景
经典使用场景
表格结构识别(Table Structure Recognition, TSR)是文档智能领域的一项核心任务,旨在从数字或物理文档图像中解析出表格的物理布局(如行、列、单元格边界)与逻辑结构(如合并单元格、表头层级)。该数据集汇总了从ICDAR2013到TabRecSet等十余个经典基准,覆盖了从156张到百万级样本的规模跨度,广泛应用于训练和评估自底向上(如CascadeTabNet)、图像到标记语言(如TableMaster)以及分割合并(如SPLERGE)等主流范式下的TSR模型。研究者常借助这些数据在统一指标下对比模型对复杂表格(如跨页、倾斜、手写表格)的鲁棒性,推动技术从实验室走向工业级应用。
解决学术问题
该数据集集合系统地解决了TSR领域长期存在的三大学术难题:一是缺乏大规模、多源标注数据导致的模型泛化性不足——通过提供PubTabNet(百万级)和FinTabNet(金融领域)等数据集,使得深度模型能够学习跨领域、跨版式的表格特征;二是表格结构评估标准不统一——整合了表格检测(TD)、结构识别(TSR)与内容识别(TCR)的标注体系,为消融实验和公平对比奠定基础;三是物理表格与逻辑表格的语义鸿沟——借助SciTSR和TabRecSet中丰富的合并单元格与复杂表头标注,催生了图神经网络(如TGRNet)和注意力机制(如TableFormer)等突破性方法,显著提升了模型对不规则表格的解析精度。
实际应用
在实际产业环境中,该数据集衍生的TSR技术已深度嵌入金融票据处理、学术文献数字化、企业报表自动化等场景。例如,基于PubTables-1M训练的Table Transformer模型被微软用于自动提取PDF中的表格数据,替代人工录入;ICDAR 2021竞赛中夺冠的PingAn-VCGroup方案依托TableMaster架构,实现了保险单证中嵌套表格的高精度解析;在医疗领域,WTW数据集支撑的场景表格识别系统能够从药房处方图像中提取药品清单,辅助库存管理。此外,OmniParser等统一框架的提出,使得TSR与文本检测、关键信息提取协同工作,进一步降低了端侧部署的工程成本。
数据集最近研究
最新研究方向
在文档智能与版面分析领域,表格结构识别(TSR)正经历从传统自底向上方法向端到端统一框架的范式跃迁。前沿研究聚焦于多模态预训练与Transformer架构的深度融合,例如CVPR 2024提出的OmniParser通过统一文本定位、关键信息抽取与表格识别任务,展现了多任务协同的潜力;而UniTable则以自监督预训练构建通用表格理解基线,突破了标注数据依赖的瓶颈。与此同时,面向复杂场景(如手写表格、异构文档)的鲁棒性研究成为热点,SEMv2采用条件卷积优化分隔线检测,TSRFormer-DQ-DETR通过动态查询增强DETR的表格解析能力,显著提升了在低质量图像上的泛化性能。值得关注的是,TabRecSet等大规模野外数据集的发布,以及WTW等涵盖数字与物理混合数据类型的资源涌现,为模型在真实世界应用(如财务报表、学术文献解析)中的落地提供了关键支撑。这些进展不仅推动了表格识别从实验室走向工业级部署,更深刻影响着自动化文档处理、知识图谱构建等领域的智能化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务