遇见数据集

Hcompany/DragOn

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

DragOn是一个用于GUI代理的拖拽-接地基准测试和训练数据集。每个示例包含一张截图、一个指令以及拖拽操作的起始和结束边界框。数据集涵盖四个领域:文本高亮、单元格选择(电子表格中的单元格选择)、元素调整大小(包括调整大小、旋转和裁剪操作)以及滑块操作。数据集总计包含286,012张训练图像和3,560,142个训练任务,并提供一个公开的评估集(包含1,000个示例,每个领域250个)用于开发,同时保留一个私有测试集用于跨模型比较。数据以tar文件格式组织,每个领域包含图像和对应的任务JSON文件,其中任务JSON包括意图、边界框坐标、领域类型和元数据等信息。

DragOn is a drag-grounding benchmark and training dataset for GUI agents. Each example consists of one screenshot, one instruction, and start/end bounding boxes for the drag operation. It covers four domains: text_highlight, sheet (cell selection), slide_resize (element resize/rotate/crop), and slider. The dataset includes a total of 286,012 training images and 3,560,142 training tasks, with a public evaluation set of 1,000 examples (250 per domain) for development, and a separate private test set for cross-model comparison. Data is organized in tar files per domain, containing images and task JSON files with fields such as intent, bounding box coordinates, domain, and metadata.

提供机构:
Hcompany
搜集汇总
数据集介绍
Hcompany/DragOn 数据集图片
构建方式
DragOn数据集面向GUI智能体中的拖拽交互任务,提供屏幕截图与自然语言指令的配对数据。每个样本包含一张截图、一条描述拖拽意图的指令,以及起始与结束边界框。数据集涵盖文本高亮、表格单元格选择、幻灯片元素调整与滑块操作四个领域,总计超过286,000张图像和356万条拖拽任务。训练数据按领域打包为tar文件,每个图像文件对应一个JSON任务文件,记录了意图、边界框坐标、领域类型及元数据等字段。评估集包含1000个公开样本,另有1000个私有测试样本用于跨模型比较。
特点
该数据集具备突出的多样性与规模优势,覆盖四种典型GUI拖拽场景,每种场景具有不同的分辨率与任务特性。边界框以图像像素坐标标注,并区分了拖拽方向是否影响结果,如文本高亮和单元格选择为无序拖拽,而元素调整与滑块操作为有序拖拽。此外,数据集引入了acc@5%、acc@10%和acc@15%等多个严格度不同的评估指标,尤其针对调整类任务采用规范化的基准线处理,以消除自由度的歧义。
使用方法
数据集以结构化文件形式发布,训练数据按领域存储为tar压缩包,评估数据则直接以文件夹组织。用户可通过tar命令解压训练数据,获取图像与对应JSON任务文件。在模型训练与评估中,可将图像与指令作为输入,预测起始与结束边界框,并依据acc@5%等标准指标进行性能衡量。公开评估集可用于开发调试,而私有测试集则作为最终性能的权威参照,适合进行跨模型的系统比较与论文成果汇报。
背景与挑战
背景概述
DragOn数据集由Nathan Bout、Maxime Langevin和Ronan Riochet于2026年在ICML SCALE Workshop上提出,专注于解决图形用户界面(GUI)代理中的拖拽操作基础问题。该数据集包含超过350万个训练样本,涵盖文本高亮、单元格选择、元素缩放与滑块操作四个领域,旨在为视觉语言模型提供细粒度的拖拽动作理解与定位能力。通过提供截图、指令及起始/结束边界框的配对数据,DragOn显著推动了GUI代理从简单点击向复杂拖拽交互的演进,填补了该方向大规模基准数据的空白,对自动化界面操作和人机交互研究具有重要影响力。
当前挑战
DragOn面临的核心挑战在于解决GUI代理对拖拽动作的精准基础定位问题,传统数据集多聚焦于点选操作,缺乏对拖拽方向、范围及语义意图的建模,导致模型在复杂界面任务中表现欠佳。在构建过程中,挑战包括:1)跨领域拖拽操作的多样性,如文本选择与滑块移动的物理约束差异;2)数据标注的精确性,需要像素级边界框标注以避免方向歧义;3)评估指标的设计,需平衡严格容忍度(如acc@5%)与任务实际容错能力,同时维护私有测试集以公正比较模型性能。
常用场景
经典使用场景
在图形用户界面(GUI)智能体研究领域,DragOn数据集主要用于训练和评估具备拖拽操作理解能力的视觉-语言模型。该数据集覆盖了文本高亮、单元格拖选、元素缩放旋转及滑块调节四大典型拖拽场景,以屏幕截图与自然语言指令配对为基础,并标注精准的起始与终止边界框,为模型学习从语言意图到像素级拖拽动作的映射提供了大规模、多模态的标准化训练素材。研究者可借助DragOn开展GUI智能体的基础能力培养,使其不仅能解析视觉界面中的元素位置关系,还能根据指令执行复杂、有序的拖拽序列,从而推动自动化界面交互向更通用、更精细化的方向演进。
衍生相关工作
DragOn数据集的发布已催生了一系列围绕GUI智能体精细操作能力提升的衍生研究。在模型架构层面,研究者借鉴DragOn的起止框标注范式,发展了基于视觉锚点预测与轨迹规划的两阶段拖拽执行框架,并在多个闭源GUI基准中刷新了空间定位准确率。在评价体系方面,acc@5%至acc@15%的梯度指标被引入后续的GUI智能体评测基准,成为衡量细粒度操作能力的重要标尺。此外,DragOn所强调的“有序”与“无序”拖拽分类,启发了对操作语义依赖性的深入分析,促使部分工作致力于构建能够从自然语言中自动判别拖拽方向敏感性的推理模块,进一步拓展了GUI智能体在多步骤任务规划与执行中的研究维度。
数据集最近研究
最新研究方向
在图形用户界面智能体(GUI Agent)的前沿探索中,拖放式交互(drag-and-drop)的精准定位与语义理解正成为视觉语言模型落地的关键瓶颈。DragOn数据集应运而生,它突破了传统元素级定位的局限,首次系统性地覆盖文本高亮、单元格选择、元素缩放旋转及滑块操作四大领域,通过海量高精度边界框标注与多样化任务定义,为模型提供了从视觉特征捕捉到空间关系推理的完整训练范本。该数据集不仅直接服务于自主办公与界面自动化等热点应用场景,其引入的acc@5%严格评估指标与私有测试集基准,更为跨模型能力比较设立了新的行业标尺,加速了GUI智能体从静态识别迈向动态操控的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务