遇见数据集

TableVerse-5K

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

TableVerse-5K 是一个专为 StrucTab 框架设计的表解析(Table Parsing)评估基准数据集。表解析任务旨在将表格图像转换为结构化的 HTML 表格。该数据集包含 5,000 个样本,每个样本均由一个表格图像、一个输入模型的指令提示(question)以及一个对应的真实 HTML 表格(ref_answer)组成。数据集内容为双语(中文和英文)表格。数据集的输出格式为标准 HTML(<table>...</table>),评估指标采用 TEDS 和 TEDS-S。数据集文件结构包含一个存储所有图像文件的 `images/` 目录,以及一个包含所有样本标注信息的 `TableVerse_5K.jsonl` 文件。该数据集主要用于评估模型在表格图像识别与结构化提取任务上的性能,仅限研究用途。

TableVerse-5K is a table parsing evaluation benchmark dataset specifically designed for the StrucTab framework. The table parsing task aims to convert table images into structured HTML tables. This dataset contains 5,000 samples, each consisting of a table image, an instruction prompt (question) input to the model, and a corresponding ground-truth HTML table (ref_answer). The dataset features bilingual (Chinese and English) tables. The output format adheres to standard HTML (<table>...</table>). The evaluation metrics adopted are TEDS and TEDS-S. The dataset's file structure includes an `images/` directory storing all image files, and a `TableVerse_5K.jsonl` file containing annotation information for all samples. This dataset is primarily used to evaluate model performance on table image recognition and structured extraction tasks, and is for research use only.

创建时间:
2026-06-29
原始信息汇总

TableVerse-5K 数据集概述

TableVerse-5K 是一个用于表格解析(Table Parsing)任务的评估基准数据集,专为 StrucTab 框架设计。其目标是将表格图像转换为结构化的 HTML 表格。

  • 任务类型:图像到文本(Image-to-Text),具体为表格解析(将表格图像转换为 HTML 表格)。
  • 语言:双语(中文和英文表格内容)。
  • 数据集规模:包含 5,000 个样本(1K < n < 10K)。
  • 评估指标:TEDS / TEDS-S。
  • 许可协议:仅供研究使用(Research Only)。

数据集结构

数据集的文件结构如下:

data/ ├── TableVerse_5K.jsonl # 所有样本的标注文件 └── images/ # 表格图像文件(*.jpg)

数据格式

TableVerse_5K.jsonl 文件中的每一行都是一个 JSON 对象,包含以下字段:

字段 类型 描述
image_path string 图像文件的相对路径(从 data/ 目录开始),同时作为唯一样本标识
question string 模型推理时与图像一起输入的指令提示(prompt)
ref_answer string 真实标注的 HTML 表格内容(<table>...</table> 格式)

使用方式

完整推理和评估脚本请参考 GitHub 仓库,基本流程如下:

  1. 克隆代码仓库并安装依赖。
  2. 将本数据集内容放置于 benchmark/data/ 目录下。
  3. 运行推理脚本。
  4. 使用 TEDS 评分服务进行评估。

引用

如果使用此数据集,请引用以下文献(占位符,待更新): bibtex @article{StrucTab_2026, title = {{StrucTab}: A Structured Optimization Framework for Table Parsing}, author = {Li, Gengluo and Peng, Shangpin and Zhang, Chengquan and Wu, Binghong and Feng, Hao and Wang, Weinong and Lyu, Pengyuan and Shen, Huawen and Wan, Xingyu and Tian, Zhuotao and Hu, Han and Ma, Can and Zhou, Yu}, journal = {arXiv preprint arXiv:2606.29905}, year = {2026} }

许可证

本数据集仅供研究目的使用。

搜集汇总
数据集介绍
TableVerse-5K 数据集图片
构建方式
TableVerse-5K是专为StrucTab框架设计的表格解析评测基准,由5,000张包含中英文内容的表格图像及其对应的结构化HTML标注构成。每张图像均与一条指令提示及标准答案HTML表格配对,形成“图像-指令-答案”三元组数据结构。数据以JSONL格式存储,图像文件独立存放于images目录下,确保数据调用的便捷性与模块化。该基准的构建严格遵循结构化优化理念,旨在为表格解析任务提供标准化的评估平台。
特点
该数据集兼具双语特性与任务导向性,涵盖中文与英文表格内容,能够有效评估模型在多语言场景下的泛化能力。其独特之处在于采用TEDS与TEDS-S作为评分指标,能够精准衡量模型输出HTML表格的结构完整性与语义正确性。此外,每一样本均包含精心设计的指令提示,使数据集不仅适用于传统表格解析模型,亦可直接用于多模态大语言模型的微调与评测。
使用方法
使用TableVerse-5K时,首先需从GitHub克隆StrucTab代码仓库并安装所需依赖,随后将数据集文件置于benchmark/data目录下。通过运行infer.py脚本,可调用兼容OpenAI API格式的模型进行推理,生成预测HTML表格。最后,执行judge.py脚本调用TEDS评判服务,即可计算模型在数据集上的TEDS与TEDS-S分数,实现对表格解析性能的标准化评估。
背景与挑战
背景概述
表格作为信息密集型文档的核心载体,在金融、科研及行政领域承载着海量结构化数据。然而,将表格图像精准转化为机器可读的HTML格式,始终是文档智能解析领域的一项艰巨挑战。在此背景下,由Li Gengluo、Peng Shangpin等学者联合提出的TableVerse-5K数据集,于2026年作为StrucTab框架的配套基准测试集正式发布。该数据集以双语(中文与英文)表格图像为核心,围绕表格解析中的指令遵循能力设计,精心挑选5000对图像-指令-答案样本,为评估模型从图像到结构化HTML的转换能力提供了标准化的测试平台。其采用TEDS与TEDS-S作为评分指标,旨在推动多模态大语言模型在表格结构化理解方面实现可重复、可量化的性能度量,对文档智能研究具有显著的推动意义。
当前挑战
TableVerse-5K数据集所聚焦的核心挑战在于表格解析这一领域难题:从非结构化的图像中还原出包含行列嵌套、跨单元格合并及复杂版式的HTML表格,要求模型具备精准的视觉定位、语义对齐与结构化生成能力,而现有模型常因缺乏对表格逻辑关系的深度建模而易产生标签缺失或层级错误。在数据构建过程中,挑战同样严峻:涵盖中英双语的表格样本需确保内容多样性与场景覆盖度,需细致校准图像分辨率和表格边框清晰度以降低光学干扰;同时,构建统一的指令模板和HTML标注格式,避免因输出格式差异带来的评分偏差,对标注的一致性和质量提出了极高要求。
常用场景
经典使用场景
在文档智能与表格理解领域,TableVerse-5K被广泛用作表格解析任务的标准化评测基准。该数据集包含5,000张涵盖中英双语的表格图像,每张图像均配有结构化HTML标签作为标准答案,并辅以指令提示。研究人员通常利用此数据集来评估模型将表格图像转换为机器可读HTML结构的能力,评测指标采用TEDS及其变体TEDS-S,从而系统性地衡量解析结果的准确性与结构完整性。
解决学术问题
TableVerse-5K着力解决表格解析领域长期存在的评测标准不统一与双语场景覆盖不足的问题。传统方法多依赖私有数据集或单一语言数据,导致模型泛化能力难以客观评估。该数据集通过提供标准化、开源的双语表格基准,使得研究者能够公平比较不同表格解析框架的性能,尤其针对中文与英文混合表格的复杂结构,推动了结构化优化策略的学术探索,并为StrucTab等系统性框架提供了可重复验证的评测基础。
衍生相关工作
TableVerse-5K的发布催生了一系列衍生研究工作。最直接的便是StrucTab框架本身,该框架基于此基准提出了结构化优化策略,显著提升了复杂表格的解析精度。此外,后续工作围绕多模态大语言模型的表格理解能力展开,部分研究利用该数据集微调视觉语言模型,以增强其对表格布局与语义的联合理解;另一些工作则针对TEDS-S指标提出改进,探索基于表格结构树形相似度的新型评测方案,进一步丰富了表格解析领域的评估体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务