遇见数据集

reducto/table-judge-benchmark

收藏
Hugging Face2026-07-10 更新2026-07-22 收录
官方服务:

资源简介:

Table Judge Benchmark 是一个用于评估表格识别或处理模型的基准测试数据集,专注于图像到文本任务。它包含538对干净和损坏的表格示例,覆盖四种合成错误类型:内容数字错误(90个案例,通过更改一个数字体单元格值实现)、内容拼写错误(90个案例,通过在一个体单元格中交换两个相邻的不同Unicode字母实现)、格式化错误(179个案例,通过在一行体单元格中对包含字母的单元格应用粗体和斜体实现)和结构错误(179个案例,通过移除一行实现)。每个表格仅应用一种固定的损坏规则。数据集规模小于1K,旨在模拟表格转录中的常见错误,但未覆盖所有失败情况,错误类型全局平衡但语言层未平衡,文件名派生的语言是粗略的来源代理,部分表格包含多种语言。

The Table Judge Benchmark is a benchmark dataset for evaluating table recognition or processing models, focusing on image-to-text tasks. It contains 538 paired clean/corrupted table examples, covering four synthetic error types: Content numeric errors (90 cases, by changing one numeric body-cell value), Content typo errors (90 cases, by transposing two adjacent distinct Unicode letters in one body cell), Formatting errors (179 cases, by bolding and italicizing letter-containing cells in one table row), and Structure errors (179 cases, by removing one row). Each table has one fixed corruption applied. The dataset size is less than 1K, designed to simulate common errors in table transcription but does not cover the full space of failures; error types are globally balanced but language strata are not, filename-derived language is a coarse provenance proxy, and some tables contain multiple languages.

提供机构:
reducto
搜集汇总
数据集介绍
reducto/table-judge-benchmark 数据集图片
构建方式
该基准测试精心构建了538对清洁与损坏配对的表格样本,覆盖四种典型错误类型:内容数值错误(90例,通过修改单一数值单元实现)、内容拼写错误(90例,通过交换相邻不同字母实现)、格式错误(179例,对同一行中字母单元应用粗斜体标注)以及结构错误(179例,通过移除一行实现)。错误注入过程遵循严格规则,例如拼写错误仅修改正文单元格而非表头或HTML实体,格式错误仅作用于含有可见字母的单元格,确保错误类型的代表性与可控性。错误类型分配文件固定了顺序及顶层类型,维持了数值与拼写错误90/90的稳定分割。
特点
该数据集的特点在于其精心设计的错误注入规则与系统性覆盖。数值与拼写错误各90例,实现了内容错误的精准控制;格式与结构错误各179例,占比更高,反映了表格转录中常见的渲染与布局失真。格式错误进一步细分为四种子场景,从全纯文本到部分已存在加粗或斜体的情况,增强了多样性。所有错误都与清洁版本一一对应,且语言层次虽非均衡,但整体错误类型分布合理。此外,数据集提供了完全可重现的构建脚本与渲染工具,支持通过命令行重新生成所有损坏样本,无需外部API调用,确保了实验的可重复性。
使用方法
用户可通过`build_benchmark.py`脚本在本地重新生成全部损坏表格,输出至指定目录。对于可视化检查,可使用`render_html.py`工具将单个HTML文件渲染为裁剪后的PNG图像,适用于WeasyPrint、PDFium等引擎。执行大规模评估时,`table-judge-run`命令支持指定多模型列表及清单路径,通过`--dry-run`模式预览8,608次调用计划,无需凭证或费用即可验证实验设计。该基准测试适用于评估视觉语言模型在表格图像转录任务中的纠错能力,通过比较模型对清洁与损坏表格的识别差异来计算性能指标。
背景与挑战
背景概述
表格作为信息密集型数据的结构化载体,在科学文献、财务报表及政务文档中扮演着不可或缺的角色。然而,从视觉文档中自动且准确地识别与解析表格内容,仍是多模态大模型面临的关键瓶颈。Table Judge Benchmark数据集由研究团队于近年创建,旨在系统评估模型对表格中细微错误的检测能力。该基准包含538组精心设计的成对洁净与损坏表格样本,覆盖数值错误、文字输入错位、格式强调(加粗/斜体)及行结构缺失等四类典型畸变。通过构建这一标准化评测平台,研究社区得以客观衡量不同视觉语言模型在表格转录保真度上的表现,为提升文档智能处理的可信度提供了关键参照。
当前挑战
该数据集所应对的核心领域挑战在于,当前多模态模型在处理表格时往往对语义无关的视觉噪点过度敏感,却容易忽视仅改数值、调换字符或删除行这类破坏语义完整性的细微错误,导致推理输出失准。构建过程中,研究者面临了两重技术难题:一是错误注入规则需保证扰动仅作用于表格正文而非标题或HTML结构,防止引入无关变量;二是文本拼写错误需避开多语言字符边界,通过定位连续可见Unicode序列、仅交换中心附近相邻异字符的策略,生成既逼真又严格的测试用例。此外,格式扰动需在保持原有内容可读性的前提下,均衡处理已有粗体、斜体及纯符号单元格,确保基准的公正性与覆盖面。
常用场景
经典使用场景
Table Judge Benchmark是一个专为评估多模态大语言模型在表格转录任务中纠错能力而设计的标准化评测基准。该数据集包含538对精心构造的干净与损坏表格样本,涵盖数值错误、文字错位、格式异常和结构缺失四类典型转录缺陷。研究者通常利用本数据集对视觉语言模型的表格理解细粒度进行定量评测,通过对比模型在检测数值偏差、识别字符级拼写错误、感知加粗斜体等格式突变以及发现行缺失等结构性故障上的表现,系统评估其从图像中准确复原表格信息的能力。这一基准为表格光学字符识别(OCR)与结构化数据抽取领域的模型性能对比提供了客观、可复现的参考标准。
实际应用
在工业级文档数字化与自动化处理管线中,Table Judge Benchmark所模拟的转录错误类型恰恰是现实场景中的高频痛点。例如,财务报告中的数值错位可引发报表分析系统的决策偏差,而表格行缺失会直接破坏数据库导入的完整性。本数据集为OCR后处理模块、表格结构化抽取服务以及企业级智能文档审阅平台的开发者提供了精准的容错性测试工具。实际部署时,开发团队可借助该基准对视觉语言模型进行压力测试,筛选出对格式重叠、跨语言表格等复杂边界条件具有更高鲁棒性的候选模型,从而在发票识别、学术文献元数据提取、法律案卷表格解析等业务中降低人工校验成本,提升端到端自动化流水线的可靠性。
衍生相关工作
围绕Table Judge Benchmark,学术界已衍生出多项具有代表性的研究工作。其错误注入规则和评测方法论被引入到表格结构识别对抗样本生成研究中,催生了如TableAttack等专注于评估模型对局部扰动敏感度的基准拓展工作。部分研究者借鉴其细粒度错误分类体系,构建了面向中文表格、多语言混合表格的垂直领域评测集。此外,该数据集的错误类型标注机制启发了若干针对OCR后校正模型的微调方法与对比学习框架,促使研究者从数据层面设计更高效的表格纠错策略。这些衍生工作共同推动了对表格理解中鲁棒性与泛化能力的持续探索,使Table Judge Benchmark成为结构化文档智能领域不可或缺的评估锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务