遇见数据集

PulseBench-Select

收藏
github2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

PulseBench-Select是一个用于文档图像中选择检测的基准数据集,包含485个标注文档图像,用于评估文档解析系统在识别选中复选框、单选按钮和标记答案选项时的准确性。数据集通过Selection F1(针对选中项目的正类精确率/召回率/F1指标)进行评分。

PulseBench-Select is a benchmark dataset dedicated to selection detection in document images. It includes 485 annotated document images, intended to evaluate the accuracy of document parsing systems when recognizing checked checkboxes, radio buttons, and marked answer options. Performance on this dataset is scored using Selection F1, a precision, recall, and F1 metric for the positive class of selected items.

创建时间:
2026-06-26
原始信息汇总

数据集概述

PulseBench-Select 是一个用于评估文档图像中选项选中检测(Selection Detection)性能的基准测试数据集。该数据集由 Pulse Software Corp. 发布,旨在衡量文档解析系统在识别已选中复选框、单选按钮和标记答案选项方面的准确性。

数据集规模

  • 包含 485 张已标注的文档图像。

评估指标:Selection F1

该基准测试采用 Selection F1 作为评分指标,该指标仅针对正类(即已选中的项目)进行精确率、召回率和 F1 分数的评估。评分过程包含三个步骤:

  1. 解析选中项目: 将真实标注和预测结果统一转换为包含样本 ID、页码、边界框、文本内容和选中状态(selected: true)的记录格式。
  2. 匹配预测与真实标注: 对于每个预测为已选中的项目,依据以下条件寻找最佳匹配的真实标注项目:
    • 相同的 sample_id
    • 相同的基于 1 的 page
    • content 的 token 重叠度 ≥ 0.80。
    • 若双方都提供了非空的八点边界框,则边界框质心距离 ≤ 0.35(归一化页面单位)。边界框质心检查作为一票否决条件,用于防止相同文本内容(例如多个“是/否”行)的错误空间匹配。
  3. 计算分数: 匹配成功的预测为正类中的真正例(TP),未匹配的为假正例(FP)或假负例(FN),并据此计算精确率、召回率和 F1 分数。

系统评测结果(Top 5)

以下为在本次发布关联的基准测试中,对 6 个系统进行评测的部分结果(按 Micro F1 排名):

排名 系统/提供商 Micro P Micro R Micro F1 Macro P Macro R Macro Skipped
1 Pulse 0.782 0.761 0.772 0.835 0.803 30
2 GPT-5.5 0.383 0.311 0.343 0.576 0.581 87
3 Gemini 3.1 Pro 0.334 0.317 0.325 0.582 0.547 60
4 Gemini 3.5 Flash 0.317 0.311 0.314 0.567 0.525 47
5 Claude Opus 4.8 0.307 0.293 0.300 0.552 0.490 44
  • Pulse 在 Micro F1 和 Macro F1 上均排名第一。
  • Macro Skipped 表示由于精确率或召回率未定义而从宏平均计算中跳过的样本数量。

数据获取与使用

  • 数据集地址(Hugging Face): https://huggingface.co/datasets/pulse-ai/PulseBench-Select
  • 评分工具: 仓库提供了一个 selection_scorer.py 脚本,可通过命令行参数执行评分。
  • 预测格式: 预测文件应为 JSON 格式,包含需要评估的选中项目列表,每个项目需包含 sample_idpagecontentselected 字段。

许可证

该项目基于 CC BY-NC-ND 4.0 许可证。

搜集汇总
数据集介绍
构建方式
PulseBench-Select是专注于文档图像中选项选中状态检测的基准测试数据集,涵盖了复选框、单选按钮及标记答案的识别任务。该数据集构建于485张经过精细标注的文档图像之上,每张图像均被转化为结构化的JSON记录,包含样本标识、页码、边界框坐标、文本内容及选中状态等关键字段。其中,边界框采用归一化的八点多边形表示,确保了空间信息的精确性。数据集的评估核心在于Selection F1指标,仅关注正类(选中项)的精确率、召回率与F1分数,从而精准度量解析系统对选中元素的捕获能力。
特点
PulseBench-Select的特色在于其严苛的匹配逻辑与聚焦正类的评价体系。匹配过程中,系统依据样本标识、页码和文本令牌重叠度(阈值0.80)进行候选关联,同时引入边界框质心距离(阈值0.35个页面单位)作为否决条件,避免了同页面重复文本项(如多个“是”或“否”选项)的错误匹配。评价阶段仅考量选中项,将匹配成功者计为真正例,未匹配的预测项与真实项分别计为假正例与假负例,最终汇聚为微观与宏观维度的精确率、召回率及F1分数。这一设计凸显了选中检测场景下的性能差异。
使用方法
使用者需准备与数据格式一致的预测结果,即JSON文件列表,每条记录包含样本ID、页码、边界框(可选)、内容及选中布尔值。运行官方提供的selection_scorer.py脚本,通过命令指定真实标注与预测结果目录,即可输出包含微观与宏观分数的JSON文件。若需忽略空间约束,可附加--centroid-max -1参数实现仅基于内容与页码的匹配。此外,借助Hugging Face datasets库加载PulseBench-Select数据集后,可将标注解压至本地目录,便于批量评估。
背景与挑战
背景概述
PulseBench-Select是由Pulse AI研究团队于近期构建的文档图像选择检测基准数据集,旨在评估文档解析系统对勾选框、单选按钮及标记答案选项的识别能力。该数据集包含485张经过精细标注的文档图像,采用独创的Selection F1评分体系,仅针对被选中项的精确率、召回率及F1值进行量化评估。随着电子文档处理与自动化表单分析技术的蓬勃发展,准确识别文档中的选择标记成为信息提取领域的核心挑战之一。PulseBench-Select的发布填补了该细分方向标准评估工具的空白,为比较不同视觉语言模型在结构化文档理解任务上的表现提供了公允且可复现的基准。
当前挑战
PulseBench-Select所应对的核心挑战在于文档图像中选中项的可靠检测。首先,文档中可能包含大量未选中的干扰选项,区分细微的勾选痕迹与普通文字排版极具难度。其次,同一页面内重复文本(如多个独立‘Yes’选项)的空间位置关系导致匹配易错,为此评分引入边界框中心距离限制机制以增强空间约束。此外,标注与预测格式的规范化、跨系统的异构预测存储、以及不同模型对图像分辨率与布局变化的敏感性,共同构成了构建与使用该基准时的实际困难。
常用场景
经典使用场景
在文档智能解析领域,选择检测(Selection Detection)是表单理解、问卷自动录入以及考试答题卡批改等任务的核心环节。PulseBench-Select 基准数据集应运而生,用于系统评估各类文档解析模型在识别已勾选复选框、单选按钮及标记选项等选中元素时的精准程度。该数据集包含 485 张精心标注的文档图像,覆盖了多样化的版面布局与选择样式,为研究者提供了标准化且富于挑战性的测试平台。其经典使用场景是作为公平、可复现的评测基准,以统一的 Selection F1 指标衡量不同模型对选中项的检出能力,从而在严格对照的条件下推动选择检测技术的进步。
实际应用
在工业应用中,PulseBench-Select 所评测的能力直接转化为高效自动化处理的现实价值。典型落地场景包括智能表单处理系统——用于自动解析保险申请表、市场调研问卷以及投票站选票中的标记项,减少人工核验成本;在线考试平台的答题卡智能批阅——快速且准确地识别考生选定的答案选项,提升阅卷效率与公正性;以及文档数字化归档——在海量纸质文件中精准定位所有被勾选或圈选的选项,构建可检索的结构化档案。通过在此基准上取得高分的模型,能够显著降低这些流程中的误判率,尤其是在噪声背景和复杂版式条件下,从而赋能企业实现从纸质到数字的高保真、高可信转换。
衍生相关工作
PulseBench-Select 的发布催生了一系列相关研究工作。一方面,它以严格的评测体系促使多模态文档理解模型(如 GPT-5.5、Gemini 系列、Claude Opus 等)在表格与表单任务上专门针对选择检测进行微调与架构改进,推动了视觉语言模型在细粒度文档元素识别方面的能力跃升。另一方面,该基准所采用的 Selection F1 评分方法论被后续研究借鉴,衍生出针对其他文档属性(如手写批注位置检测、盖章区域识别)的专门评测标准。此外,数据集本身也刺激了数据增强与合成训练策略的创新——研究者尝试通过模拟不同字体、旋转角度和标记样式生成大规模训练样本,以弥补真实标注样本的不足,从而构建出更具泛化性的选择检测模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务