Novylab/GUI_grounding
收藏官方服务:
资源简介:
我们分享了一个全面的GUI指令基础数据集,包含2646张桌面截图图像及其注释。截图图像位于images文件夹中,注释文件位于annotations文件夹下。注释JSON主要遵循coco注释结构,并添加了一些额外的键。提供了7种屏幕元素类别:按钮、标签、文本字段/区域、链接、复选框、单选按钮和列表。
A comprehensive GUI instruction grounding dataset containing 2646 desktop screenshot images along with their annotations. The screenshot images are located in the images folder and the annotation file is located under annotations. The annotation JSON largely follows the COCO annotation structure with a few additional keys. The dataset provides 7 screen element categories: Button, Tab, Text field/area, Link, Checkbox, Radio button, and List.
提供机构:
Novylab搜集汇总
数据集介绍

构建方式
在图形用户界面(GUI)自动化与智能交互领域,精准的指令定位是提升用户体验与系统效率的关键。该数据集名为Novylab/GUI_grounding,旨在为GUI指令接地任务提供高质量的标注资源。其构建方式基于对2646张桌面截图图像的细致收集与处理,所有截图图像存储于“images”文件夹中,对应的注释文件则位于“annotations”路径下。注释格式借鉴了经典的COCO标注结构,并在此基础上扩展了若干自定义键,以适配GUI元素的特性。数据集涵盖了七类屏幕元素,包括按钮、选项卡、文本字段/区域、链接、复选框、单选按钮和列表,确保了多样化的交互场景覆盖。
特点
该数据集的核心特点在于其针对GUI指令接地任务的专门化设计。通过采用COCO风格的注释结构,数据集不仅提供了标准的边界框标注,还通过额外键值增强了语义信息,使得模型能够更精确地理解指令与界面元素的对应关系。七种元素类别的划分覆盖了桌面应用中常见的交互组件,从基本的按钮到复杂的列表,赋予了数据集在跨场景泛化上的潜力。此外,2646张截图的规模虽不算庞大,但经过精心挑选与标注,确保了样本的代表性与多样性,为小样本学习或迁移学习提供了坚实基础。
使用方法
使用该数据集时,研究者可直接从HuggingFace平台加载,将“images”目录下的截图与“annotations”中的JSON注释文件配合使用。注释遵循COCO格式,因此可无缝集成到现有的计算机视觉流水线中,例如使用PyTorch的torchvision或Detectron2等框架进行模型训练。具体步骤包括解析JSON以获取图像ID、类别标签及边界框坐标,随后构建数据加载器进行迭代训练。对于GUI指令接地任务,建议将截图作为输入,注释中的类别与位置作为监督信号,以训练模型预测给定指令对应的屏幕元素。
背景与挑战
背景概述
图形用户界面(GUI)作为人机交互的核心载体,其元素理解与定位是自动化任务执行与无障碍技术发展的关键基石。近年来,随着深度学习在计算机视觉领域的突破,研究者们致力于将视觉语言模型应用于GUI理解,然而缺乏高质量、细粒度的指令级标注数据集成为该领域发展的桎梏。在此背景下,Novylab团队于近期发布了GUI_grounding数据集,该数据集由2646张桌面截图及其详尽标注构成,遵循COCO格式并扩充了关键字段,旨在为GUI元素的精准定位与分类提供标准化基准。数据集覆盖按钮、标签页、文本框等七类核心界面组件,其创建有效填补了桌面环境GUI理解领域的数据空白,为后续多模态模型在界面自动化、智能辅助等场景下的研究提供了关键支撑,对推动人机交互智能化进程具有显著学术价值。
当前挑战
当前GUI_grounding数据集面临的核心挑战集中于领域问题与构建过程两个层面。就领域问题而言,桌面GUI元素具有高度异构性——不同软件界面在布局、主题、缩放比例上差异显著,且元素间存在复杂的层级遮挡关系,这对模型的细粒度视觉定位能力提出严苛要求,远非传统图像分类或目标检测任务所能涵盖。在构建过程中,数据集仅包含2646张截图,样本规模有限且类别分布可能不均,七类元素中如复选框与单选按钮的出现频率显著低于按钮等常见组件,易导致模型产生类别偏差。此外,桌面环境截图天然包含敏感信息(如用户文件、登录界面),如何在保证数据隐私的同时扩充样本多样性,以及确保标注框在密集元素场景下的边界一致性,均为数据集后续迭代需攻克的技术难点。
常用场景
经典使用场景
在图形用户界面(GUI)自动化与智能交互的研究领域中,GUI元素定位与指令理解是连接自然语言意图与界面操作的核心桥梁。Novylab/GUI_grounding数据集专注于桌面环境下的界面截图,提供了2646张涵盖按钮、标签页、文本框、链接、复选框、单选按钮及列表等七类常见组件的精细标注。其经典使用场景在于训练与评估多模态模型,使其能够根据自然语言指令(如“点击提交按钮”或“勾选同意条款”)在截图中精准定位目标元素,从而构建端到端的GUI指令跟随系统。这一场景不仅考验模型对视觉语义的理解能力,还要求其具备对界面布局与交互逻辑的深层推理能力。
衍生相关工作
基于该数据集,学术界已衍生出一系列具有影响力的经典工作。研究者们利用其标注结构开发了多尺度特征融合的定位网络,如引入注意力机制的Transformer变体模型,显著提升了在密集界面中的元素识别精度。另有一些工作专注于指令与视觉区域的跨模态对齐,提出了基于对比学习的预训练范式,使得模型能够从少量样本中快速适应新界面。此外,针对数据集中七类元素的分布特性,相关工作还探索了长尾分布下的鲁棒学习策略,并催生了针对GUI场景的大规模预训练模型(如UIBert系列),进一步拓展了界面理解的理论与实践深度。
数据集最近研究
最新研究方向
在图形用户界面(GUI)自动化与智能交互的前沿领域,Novylab/GUI_grounding数据集为基于视觉的界面元素定位研究提供了关键支撑。该数据集涵盖2646张桌面截图及遵循COCO格式的精细标注,聚焦按钮、标签、文本框等七类核心组件,其发布恰逢大型语言模型与视觉理解技术加速融合的浪潮。当前研究热点集中于利用此类数据训练能够精准理解界面布局与语义的深度学习模型,进而推动无代码自动化、辅助功能开发以及智能测试生成等应用。该数据集的出现不仅弥补了桌面GUI领域高质量标注资源的稀缺,更成为连接计算机视觉与人类-计算机交互研究的重要桥梁,其影响正逐步延伸至移动端与Web端界面理解范式的统一探索。
以上内容由遇见数据集搜集并总结生成



