遇见数据集

pointerbench

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

Pointerbench是一个用于计算机使用模型的小型GUI基础基准测试套件,旨在评估模型在图形用户界面(GUI)中定位和交互元素的能力。数据集包含三个独立的子集:pointerbench-sheets(500个样本)专注于电子表格中的单元格、颜色、表头、边缘、角落和相对位置;pointerbench-text(500个样本)测试单词、字符、标点、光标位置、浏览器文本、文本边界框和发票字段;pointerbench-pro(500个样本)涵盖100个专业应用程序中的图标、文本和混合GUI目标。所有样本均包含一张合成的1024x768 PNG格式截图、一条任务指令、绝对像素坐标下的目标几何信息(点或边界框)以及一个二进制评估规则。数据模式为JSONL格式,每个样本包含文件名称、唯一ID、指令、目标边界框、目标点坐标、答案类型(点或边界框)、评估规则、数据类型、类别和图像尺寸等字段。评估时,点任务要求预测点落在目标边界框内;边界框任务采用非对称重叠规则,要求真实边界框几乎被完全覆盖(覆盖率≥0.90)且预测边界框保持相对紧凑(精确度≥0.70)。该数据集适用于图像到文本、视觉问答等任务,特别是GUI基础、计算机使用和屏幕交互相关的研究与评估。数据集采用CC BY 4.0许可证发布。

Pointerbench is a small GUI-based benchmark suite for computer usage models. The dataset is designed to evaluate the ability of models to locate and interact with elements in graphical user interfaces (GUIs). It consists of three independent subsets: pointerbench-sheets (500 samples) focuses on cells, colors, headers, edges, corners, and relative positions in spreadsheets; pointerbench-text (500 samples) tests words, characters, punctuation, cursor positions, browser text, text bounding boxes, and invoice fields; pointerbench-pro (500 samples) covers icons, text, and mixed GUI targets from 100 professional applications. All samples include a synthetic 1024x768 PNG screenshot, a task instruction, target geometry information (point or bounding box) in absolute pixel coordinates, and a binary evaluation rule. The data format is JSONL, with each sample containing fields such as file name, unique ID, instruction, target bounding box, target point coordinates, answer type (point or bounding box), evaluation rule, data type, category, and image dimensions. For evaluation, point tasks require the predicted point to fall within the target bounding box; bounding box tasks use an asymmetric overlap rule, requiring the ground truth bounding box to be almost fully covered (coverage ≥ 0.90) and the predicted bounding box to remain relatively compact (precision ≥ 0.70). The dataset is suitable for tasks like image-to-text and visual question answering, particularly for GUI-based, computer usage, and screen interaction research and evaluation. It is released under the CC BY 4.0 license.

创建时间:
2026-06-22
原始信息汇总

数据集概述:Pointerbench

Pointerbench 是一个小型的GUI定位基准测试套件,用于评估计算机操作模型的GUI元素定位能力。每个样本包含一张截图、一条指令、目标在绝对像素坐标下的几何信息以及一个二元评估规则。

基本信息

  • 许可证: CC BY 4.0
  • 任务类别: 图像到文本、视觉问答
  • 语言: 英语、德语、法语、西班牙语、意大利语、荷兰语
  • 标签: GUI定位、计算机使用、基准测试、截图、合成数据、电子表格、文本定位、专业应用
  • 数据规模: 1K < n < 10K

数据集链接

  • GitHub: https://github.com/warmwindOS/pointerbench
  • 博客文章: https://about.warmwind.com/pointer-bench/
  • Pointer 1.5 介绍: https://about.warmwind.com/pointer-1-5-teaching-ai-to-click/
  • 官方排行榜提交: https://warmwind.com/contact

数据集结构

Pointerbench 包含三个子集,每个子集独立封装:

子集 样本数 测试内容
pointerbench-sheets 500 电子表格中的单元格、颜色、表头、边、角及相对位置
pointerbench-text 500 单词、字符、标点、光标位置、浏览器文本、文本边界框及发票字段
pointerbench-pro 500 100个专业应用程序中的图标、文本及混合GUI目标

所有图像均为合成的1024x768 PNG截图,不包含爬取的用户数据或个人信息。

数据布局

每个子集均包含以下文件结构:

pointerbench-sheets/ # 或 pointerbench-text/ 或 pointerbench-pro/ data/test/metadata.jsonl data/test/0000.png eval.py README.md REPRODUCE.md

数据模式

每条 metadata 记录包含以下字段:

json { "file_name": "0000.png", "id": "pbs_0000", "instruction": "Click cell E11.", "bbox": [x1, y1, x2, y2], "point": [x, y], "answer_type": "point", "eval": {"type": "point_in_bbox", "bbox": [x1, y1, x2, y2]}, "data_type": "cell", "category": "cell_ref", "image_size": [1024, 768] }

评估方法

  • 点任务: 预测点落在目标边界框内即为正确。
  • 边界框任务 (用于 Pointerbench-Text): 采用非对称重叠规则。命中要求真实框被预测框几乎完全覆盖(覆盖率 >= 0.90),且预测框紧贴真实框(精确度 >= 0.70)。该规则更严厉地惩罚剪切目标部分的预测,而对包含额外边缘的预测相对宽容。

运行评估: 在子集文件夹内执行以下命令: bash python eval.py --predictions preds.jsonl

预测文件应为JSONL格式,每条记录包含 id 及根据 answer_type 字段决定的 pointbbox

使用建议

推荐的推理提示(可通过 python eval.py --show-system-prompt 查看):

You are evaluating Pointerbench, a GUI grounding benchmark. You will receive one 1024x768 screenshot and one task instruction. Use absolute pixel coordinates with origin at the top-left of the image. Do not return normalized coordinates. Do not crop or resize the coordinate frame. For point tasks, return JSON like {"point": [x, y]}. For bounding-box tasks, return JSON like {"bbox": [x0, y0, x1, y1]}.

可根据推理栈调整提示,但需保持1024x768的绝对像素坐标框架,并报告任何图像缩放或多步缩放策略。

许可证

  • 数据集图像和标注: CC BY 4.0
  • 评估脚本: MIT
搜集汇总
数据集介绍
pointerbench 数据集图片
构建方式
Pointerbench 是一个专为计算机使用模型设计的小型 GUI 接地基准测试套件,旨在评估模型在图形用户界面中定位目标元素的能力。该数据集由三个子集构成,每个子集包含 500 个样本,分别聚焦于电子表格单元格、文本元素以及专业应用程序图标与混合 GUI 目标。所有样本均采用合成生成的 1024×768 像素 PNG 截图,确保无任何真实用户数据或个人信息泄露。每个样本包含一张截图、一条指令、以绝对像素表示的目标几何信息以及一个二值评估规则,为模型提供清晰的测试标准。
特点
该数据集的核心特点在于其精细化的评估规则与任务多样性。针对点任务,模型预测的点坐标需落入目标边界框内即视为正确;而边界框任务则采用非对称重叠规则,要求真实框覆盖率不低于 0.90,且预测框精确度不低于 0.70,以严格惩罚部分遮挡目标的预测行为。此外,数据集涵盖电子表格中的单元格引用、颜色、标题等逻辑推理,文本中的字符级定位与票据字段识别,以及横跨 100 款专业应用程序的图标与文本混合定位,全面考察模型在不同界面场景下的接地能力。
使用方法
使用方法上,用户可在各子集目录下运行配套的 eval.py 脚本进行模型评估,需提供 JSONL 格式的预测文件,每条记录包含任务 ID 及对应的点或边界框坐标。官方推荐使用绝对像素坐标,以图像左上角为原点,避免归一化坐标导致的偏差。用户还可通过 `--show-system-prompt` 参数获取建议的推理提示模板,并根据自身推理栈进行调整,但需保持坐标框架固定,并报告任何图像缩放或多步缩放策略。详细的分布信息、模式细节与示例可参阅各子集的 README 文档。
背景与挑战
背景概述
随着图形用户界面(GUI)自动化与计算机使用领域大语言模型(LLM)的迅猛发展,精准定位屏幕元素的能力成为衡量模型实际应用价值的关键指标。在此背景下,由Warmwind团队于近年开发的Pointerbench数据集应运而生,旨在系统评估模型对GUI元素的点选与框定能力。该数据集包含三个精心设计的子集,分别聚焦于电子表格单元格、文本对象以及100种专业应用程序中的图标与文字,共计1500个合成样本,覆盖了多种复杂定位场景。其创建不仅为GUI grounding任务提供了标准化测试基准,更通过严格的评估规则推动了该领域研究从粗略的问答向精准的空间交互迈进,对计算机视觉与语言模型的交叉研究具有显著的引领作用。
当前挑战
Pointerbench数据集所面临的挑战主要体现在两个维度。其一,在领域问题层面,它聚焦于解决当前大语言模型在GUI操作中普遍存在的“视觉接地”难题,即模型需精准理解自然语言指令与屏幕像素坐标间的对应关系,尤其在单元格边界模糊、文本字符密集及图标视觉重叠等场景中极具挑战性。其二,在数据集构建过程中,为规避用户隐私泄露风险,团队完全采用合成截图,这要求生成数据必须高度逼真且覆盖真实应用中的边缘案例,例如编辑框中的插入符位置或电子表格的复杂表头结构。此外,设计非对称的边界框评估规则以区分“过度包含”与“切分目标”两类错误,进一步增加了评估标准的复杂性与难度。
常用场景
经典使用场景
Pointerbench 作为一项专为计算机使用模型设计的 GUI 定位基准测试套件,其经典使用场景聚焦于评估模型在数字界面中精准定位并交互的能力。该数据集通过合成截图与精确像素坐标标注,模拟了用户在电子表格、文本编辑及专业应用中的典型操作,要求模型根据自然语言指令在 1024×768 的固定画幅内返回点坐标或边界框。这一设定使得 Pointerbench 成为检验视觉语言模型在细粒度图形用户界面理解与操作方面性能的标杆,尤其适用于衡量模型对单元格、字符、图标等复杂 GUI 元素的定位精度。
衍生相关工作
Pointerbench 的推出催生了一系列相关研究工作,尤其在视觉定位与计算机使用模型的交叉领域。其严谨的评估体系为后续研究提供了可参照的模板,例如基于该基准改进的定位模块被集成到 Pointer 1.5 模型中,用以提升其在复杂界面下的点击准确度。此外,围绕该数据集衍生出对不对称重叠规则的理论分析,推动了边界框评估方法的精进。研究者还借鉴其合成数据生成策略,拓展出面向更多专业领域的定位基准,如医疗影像界面和工业控制面板的交互测试。这些衍生工作共同构成了一个日益丰富的学术生态,持续推动 GUI 智能交互技术的发展。
数据集最近研究
最新研究方向
Pointerbench作为一款专为计算机使用模型设计的GUI定位基准测试集,正成为多模态交互研究的前沿热点。该数据集通过合成截图模拟专业应用、文本和电子表格三种场景,精准评估模型在绝对像素坐标下的指令跟随与元素定位能力。随着AI代理在自动化办公、用户界面导航等领域的兴起,Pointerbench所定义的“点内bbox”与“非对称覆盖”评估规则,为量化模型对GUI元素的感知精度提供了标准化框架,推动了从视觉问答到细微交互控制的技术跃迁。其合成数据的特性确保了研究的可复现性,而100款专业应用的覆盖则使评估更贴近真实商业场景,加速了可在复杂软件环境中自主操作的智能系统的研发进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务