遇见数据集

kl3269/tablesense

收藏
Hugging Face2024-11-23 更新2024-12-14 收录
官方服务:

资源简介:

TableSense数据集源自Tablesense论文和GitHub仓库,专注于电子表格中的表格检测任务。该任务旨在检测给定电子表格中的所有表格并定位其范围。数据集基于三个公开数据集(VEnron2, VEUSUS, 和 VFUSE)进行标注,这些数据集在电子表格领域广泛使用。为了减少重复标注,使用了SpreadCluster聚类相似表格的方法。数据集的处理包括从.xls转换为.xlsx格式,以及使用ClosedXML提取特征。最终数据集包含2,615个表格,来自1,645个电子表格。数据集结构包括文件路径、工作表名称、数据集划分(训练集或测试集)以及表格区域列表。

The TableSense Dataset is a dataset for table detection in spreadsheets, developed based on the TableSense paper and GitHub repository. This dataset annotates table regions in three public datasets (VEnron2, VEUSUS, and VFUSE) to provide detailed table location information. The dataset structure includes file path, sheet name, dataset split (training set or testing set), and table region information (start column, start row, end column, end row). The annotation process involves converting original Excel files to .xlsx format and using ClosedXML to read and extract features, resulting in 2,615 tables.

提供机构:
kl3269
搜集汇总
数据集介绍
构建方式
TableSense数据集源自微软研究院提出的同名论文,旨在解决电子表格中表格检测这一关键问题。该数据集基于三个广泛使用的公开语料库——VEnron2、VEUSES和VFUSE构建而成,这些语料库已通过SpreadCluster方法对相似表格进行了聚类,以避免重复标注。在构建过程中,原始Excel文件首先被从.xls格式转换为.xlsx格式,随后利用ClosedXML库读取并提取特征,排除了转换或处理失败的文件。每个聚类中选取一个代表性文件,并仅对包含多个工作表的文件中的前两个工作表进行标注。所有标注结果均经过至少两人的审核,争议样本被剔除,最终得到来自1,645个电子表格的2,615个表格区域。
特点
该数据集的核心特点在于其专注于电子表格领域的表格检测任务,提供了精细的表格区域标注信息。每个样本包含源文件路径、工作表名称、数据集划分标签以及表格区域列表,其中表格区域以起始列、起始行、结束列和结束行的形式精确定位。数据集规模介于1千至1万之间,覆盖了真实世界中的多样化电子表格场景。此外,数据集采用了明确的训练集与测试集划分,便于研究者进行模型训练与评估。其标注过程严格遵循多人交叉验证机制,确保了标注质量的高度可靠性与一致性。
使用方法
使用TableSense数据集时,可通过HuggingFace的datasets库便捷加载。用户只需调用load_dataset函数并指定数据集标识符"kl3269/tablesense",即可获取全部数据。加载后的数据集以字典形式呈现,每个条目包含filepath、sheet_name、split及table_regions字段。table_regions字段为列表结构,其中每个元素包含start_col、start_row、end_col和end_row四个键,分别对应表格的起始列字母、起始行数字、结束列字母和结束行数字。研究者可基于这些结构化信息直接构建表格检测模型,或将其转换为其他常见格式以适应不同的深度学习框架。
背景与挑战
背景概述
电子表格作为数据存储与分析的基石,其内部表格结构的自动检测是数据智能化的关键前置步骤。TableSense数据集由微软研究院于2021年提出,旨在利用卷积神经网络解决电子表格中的表格检测问题。该数据集基于VEnron2、VEUSES和VFUSE三个公开的电子表格语料库,这些语料库通过SpreadCluster方法聚类以减少重复标注,最终从1,645个电子表格中标注了2,615个表格区域。数据集的发布为电子表格领域的数据驱动模型提供了标准化训练与评估基准,显著推动了表格检测技术从规则驱动向数据驱动的范式转变,成为该领域影响力深远的基础资源。
当前挑战
TableSense数据集所面临的挑战主要体现在两个层面。其一,在领域问题层面,电子表格表格检测需应对表格边界模糊、多表格共存、跨行跨列合并等复杂布局,远较图像中规则表格检测困难。其二,在数据集构建过程中,原始Excel文件需从.xls转换为.xlsx格式,部分文件在转换或特征提取时失败而被排除;此外,为保证标注质量,每个表格由至少两人独立标注并排除争议样本,但不同标注者对表格边界的理解差异仍可能引入噪声。这些挑战共同构成了电子表格智能理解研究的核心难点。
常用场景
经典使用场景
在电子表格智能解析与办公自动化领域,TableSense数据集专为基于卷积神经网络的电子表格表格检测任务而设计。其经典使用场景在于训练和评估模型自动识别电子表格中所有表格的精确范围,包括起始行、起始列、结束行和结束列。研究者可加载该数据集,利用其标注的表格区域信息,构建端到端的表格检测系统,从而实现对复杂电子表格结构的自动化理解与信息抽取。
解决学术问题
该数据集有效解决了电子表格领域长期存在的表格检测缺乏大规模、高质量标注数据的问题。在学术研究中,它填补了从非结构化电子表格中自动定位表格范围的空白,为数据驱动模型提供了可靠的训练基准。通过基于VEnron2、VEUSES和VFUSE三大公开数据集的聚类与人工标注,TableSense显著提升了表格检测的准确性与鲁棒性,推动了电子表格智能处理从规则驱动向数据驱动的范式转变。
衍生相关工作
TableSense数据集衍生了多项经典研究工作,包括基于卷积神经网络的电子表格表格检测模型(TableSense论文本身)、后续的电子表格语义解析任务,以及跨文档表格结构识别方法。这些工作进一步探索了表格检测与表格结构理解、内容提取的联合建模,推动了电子表格智能处理领域的发展,并为后续如电子表格问答、自动化数据管道构建等应用奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务