PulseBench-Select
收藏资源简介:
PulseBench-Select是一个用于文档图像中选择检测的基准数据集,包含485个标注文档图像,用于评估文档解析系统在识别选中复选框、单选按钮和标记答案选项时的准确性。数据集通过Selection F1(针对选中项目的正类精确率/召回率/F1指标)进行评分。
PulseBench-Select is a benchmark dataset dedicated to selection detection in document images. It includes 485 annotated document images, intended to evaluate the accuracy of document parsing systems when recognizing checked checkboxes, radio buttons, and marked answer options. Performance on this dataset is scored using Selection F1, a precision, recall, and F1 metric for the positive class of selected items.
数据集概述
PulseBench-Select 是一个用于评估文档图像中选项选中检测(Selection Detection)性能的基准测试数据集。该数据集由 Pulse Software Corp. 发布,旨在衡量文档解析系统在识别已选中复选框、单选按钮和标记答案选项方面的准确性。
数据集规模
- 包含 485 张已标注的文档图像。
评估指标:Selection F1
该基准测试采用 Selection F1 作为评分指标,该指标仅针对正类(即已选中的项目)进行精确率、召回率和 F1 分数的评估。评分过程包含三个步骤:
- 解析选中项目: 将真实标注和预测结果统一转换为包含样本 ID、页码、边界框、文本内容和选中状态(
selected: true)的记录格式。 - 匹配预测与真实标注: 对于每个预测为已选中的项目,依据以下条件寻找最佳匹配的真实标注项目:
- 相同的
sample_id。 - 相同的基于 1 的
page。 content的 token 重叠度 ≥ 0.80。- 若双方都提供了非空的八点边界框,则边界框质心距离 ≤ 0.35(归一化页面单位)。边界框质心检查作为一票否决条件,用于防止相同文本内容(例如多个“是/否”行)的错误空间匹配。
- 相同的
- 计算分数: 匹配成功的预测为正类中的真正例(TP),未匹配的为假正例(FP)或假负例(FN),并据此计算精确率、召回率和 F1 分数。
系统评测结果(Top 5)
以下为在本次发布关联的基准测试中,对 6 个系统进行评测的部分结果(按 Micro F1 排名):
| 排名 | 系统/提供商 | Micro P | Micro R | Micro F1 | Macro P | Macro R | Macro Skipped |
|---|---|---|---|---|---|---|---|
| 1 | Pulse | 0.782 | 0.761 | 0.772 | 0.835 | 0.803 | 30 |
| 2 | GPT-5.5 | 0.383 | 0.311 | 0.343 | 0.576 | 0.581 | 87 |
| 3 | Gemini 3.1 Pro | 0.334 | 0.317 | 0.325 | 0.582 | 0.547 | 60 |
| 4 | Gemini 3.5 Flash | 0.317 | 0.311 | 0.314 | 0.567 | 0.525 | 47 |
| 5 | Claude Opus 4.8 | 0.307 | 0.293 | 0.300 | 0.552 | 0.490 | 44 |
- Pulse 在 Micro F1 和 Macro F1 上均排名第一。
Macro Skipped表示由于精确率或召回率未定义而从宏平均计算中跳过的样本数量。
数据获取与使用
- 数据集地址(Hugging Face):
https://huggingface.co/datasets/pulse-ai/PulseBench-Select - 评分工具: 仓库提供了一个
selection_scorer.py脚本,可通过命令行参数执行评分。 - 预测格式: 预测文件应为 JSON 格式,包含需要评估的选中项目列表,每个项目需包含
sample_id、page、content和selected字段。
许可证
该项目基于 CC BY-NC-ND 4.0 许可证。




