遇见数据集

gui-visual-delta

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集名为GUI Visual Delta,旨在为GUI世界模型(World Model)训练提供视觉残差标签。数据集中标注了可访问性树(a11y tree)无法通过结构表示的各种视觉变化,例如选择状态、焦点、活动选项卡、菜单遮挡、渲染内容、滚动和格式变化等。标签由视觉语言模型(VLM)根据前后截图、动作和树差异生成,但世界模型在训练时仅使用前状态和动作作为输入。数据集包含两个主要来源:OSWorld(20,771个过渡,全部来自分支)和GUI-360(87,985个训练过渡,以及150个测试样本)。每个残差记录包含唯一标识符、领域、动作、残差数组(包括类型、目标、边界框、描述、因果、前后内容、验证状态和树可表达性)以及像素是否变化、动作效果不匹配等标志。统计信息显示,OSWorld中验证率为99.2%,GUI-360中为98.5%;每过渡残差行数分别为1.09和1.47;无变化阴性样本比例分别为10.8%和6.9%。两个数据集互补:GUI-360的UIA树不包含单元格值、选择状态和功能区活动选项卡,OSWorld的AT-SPI树则缺少菜单覆盖。验证实验表明,残差文本包含树外判别信息(判别测试89%)且约一半信号可通过学习恢复(预测性探测kind召回率53.5%)。注意事项包括:已验证状态仅表示像素位置存在变化而非语义准确;标签为单次采样;遮挡并非元素移除;GUI-360存在动作效果不匹配和空动作问题;标签为合成数据。数据集许可证遵循原始数据:OSWorld衍生部分为Apache-2.0,GUI-360衍生部分需遵守原作者条件。

The dataset is named GUI Visual Delta, designed to provide visual residual labels for training GUI world models. It annotates various visual changes that cannot be structurally represented by the accessibility tree (a11y tree), such as selection states, focus, active tabs, menu occlusion, rendered content, scrolling, and format changes. The labels are generated by a vision-language model (VLM) based on before/after screenshots, actions, and tree differences, but the world model only uses the preceding state and action as input during training. The dataset includes two main sources: OSWorld (20,771 transitions, all from branches) and GUI-360 (87,985 training transitions, plus 150 test samples). Each residual record contains a unique identifier, domain, action, residual array (including type, target, bounding box, description, causality, before/after content, verification status, and tree expressibility), as well as flags like pixel change and action effect mismatch. Statistics show verification rates of 99.2% for OSWorld and 98.5% for GUI-360; average residual rows per transition are 1.09 and 1.47; negative sample proportions without change are 10.8% and 6.9%. The two datasets are complementary: GUI-360s UIA tree lacks cell values, selection states, and ribbon active tabs, while OSWorlds AT-SPI tree lacks menu overlays. Validation experiments indicate that residual text contains out-of-tree discriminative information (discriminative test 89%) and about half of the signals can be recovered through learning (predictive probing kind recall 53.5%). Notes include: verified status only indicates pixel position changes, not semantic accuracy; labels are single-sampled; occlusion is not element removal; GUI-360 has action effect mismatch and empty action issues; labels are synthetic. The dataset license follows the original data: OSWorld-derived parts are Apache-2.0, and GUI-360-derived parts must comply with the original authors conditions.

创建时间:
2026-08-17
原始信息汇总

GUI Visual Delta 数据集概述

数据集定位

GUI Visual Delta 是一个用于训练 GUI 世界模型(World Model, WM)的视觉变化残差标注数据集,规模为 100K 至 1M 条记录。其核心目标是捕捉辅助功能树(a11y tree)在结构上无法表达的视觉变化——包括选择状态、焦点、活动标签页、被菜单遮挡的区域、渲染内容、滚动状态及格式变化等,并通过视觉语言模型(VLM)将其转化为文本标签。该数据集基于 Apache-2.0 许可,语言为英语,标注任务类别为 "other"。

数据来源

原始数据不包含在本仓库内,需从以下两个上游数据集获取:

  • gui-wm/osworld-wm-branching
  • vyokky/GUI-360

数据组成

路径 行数 内容
residuals/osworld/residuals_full_graded.jsonl 20,771 OSWorld 分支全量残差(正本)
residuals/osworld/residuals_full_awbfmt.jsonl 20,771 按树形 7 列格式序列化
residuals/gui360/residuals_train_full_graded.jsonl 87,985 GUI-360 train 全量残差(正本)
residuals/gui360/residuals_train_full_awbfmt.jsonl 87,985 7 列序列化版本
residuals/gui360/residuals_test_poc.jsonl 150 GUI-360 test 概念验证
trainsets/gui360_vd_full/{armA,armB,armC} 每 arm 77,193 / 4,367 study2 77k 与残差连接;arm C 为 seed 7 随机安慰剂
trainsets/{gui360_vd_mini,osworld_vd_mini} 约 6,000 迷你 SFT 复现用
study2/data 77,247 / 4,370 GUI-360 WM 训练集(可再生,避免 35GB 原始数据)
study2/study0/transitions*.jsonl.gz 84,715 更换门控重建时的中间产物
osworld/cond_none 14,187 / 2,149 / 1,409 OSWorld WM 训练集(无指令/历史条件)
experiments/ 判别测试、可预测性探针、迷你 SFT 评分结果
docs/REPRODUCTION.md 环境到训练评估全流程复现文档(起点)
docs/PROMPTS_AND_FLAGS.md 提取、WM、策略、BoN 的 prompt 来源及执行参数
docs/MIGRATION_GPU26.md 数据目录规则及新服务器执行顺序

残差记录 Schema

每条残差记录包含以下字段:

  • uid:唯一标识(task_id 与行号或 app/mode/eid 组合)
  • domain:应用领域
  • action:具体操作(如 pyautogui 点击坐标)
  • residual:包含 kind(类型:selection、active_tab、focus、content、menu_overlay、occlusion、rendered_media、scroll、formatting、other)、target、bbox、desc、causal、before/after_content、verify、tree_expression 等
  • pixel_unchanged:像素无变化时残差为空(负样本)
  • action_effect_mismatch:点击但树无变化的数据缺陷标记
  • tree_add、tree_rem、diff_frac:树 diff 统计
  • prompt_ver:生成提示版本

实测统计

指标 OSWorld GUI-360
转移数 20,771 87,985
残差行数 20,196 120,143
verified 比例 99.2% 98.5%
每转移残差行数 1.09 1.47
无变化负样本 2,249 (10.8%) 6,062 (6.9%)
主要类型 occlusion 21%、selection 18%、menu_overlay 18% content 19%、occlusion 19%、selection 19%
not_expressed(树未表达) 46.8% 43.0%

两类数据源在盲区上互补:GUI-360 UIA 菜单以节点包含,但不含单元格值、选择状态、ribbon 标签页;OSWorld AT-SPI 含文本,但遗漏菜单覆盖层。

无学习验证结果

  • 判别测试:给定相同的树,区分残差块对应的屏幕,准确率 89%(偶然水平 50%,n=100,95% CI 82.9–95.1),证明残差文本含树外判别信息。
  • 可预测性探针:仅用 before 树加动作进行 zero-shot 预测,kind 召回率 53.5%,kind+bbox 为 39%,表明约半数可被学习信号回收。

使用注意事项

  1. verified 仅表明 bbox 内存在像素变化的位置必要条件,非语义准确性;语义验证仅 40 例人工审查(0 错误),样本量小。
  2. 标签为单次采样,未做多次采样以估计噪声。
  3. occlusion 不等于元素移除,被遮挡元素仍留于树中,不可当作存在性消失处理。
  4. GUI-360 有 4.2% action_effect_mismatch 及 3.9% 空动作,纳入训练时应考虑剔除;OSWorld 仅 1 例 mismatch。
  5. 标签为合成数据,由 gpt-5.6-luna(effort low)生成,提示版本随记录保存。
  6. 派生数据的许可遵循原数据集:OSWorld 派生为 Apache-2.0,GUI-360 派生需遵守原作者条款。

开始使用

使用 hf download gui-wm/gui-visual-delta --repo-type dataset --local-dir ./gui-visual-delta 下载,并优先阅读 docs/REPRODUCTION.md 了解环境配置、复现顺序及常见陷阱。

搜集汇总
数据集介绍
gui-visual-delta 数据集图片
构建方式
该数据集构建的核心在于利用视觉语言模型(VLM)对GUI世界模型训练中可访问性树(a11y tree)未能捕捉的视觉变化进行标注。数据源自OSWorld和GUI-360两个平台,通过对比前后截图、用户操作及树差异,生成结构化残差记录。每个残差包含变化类型(如选择状态、焦点、遮挡等)、目标边界框、文本描述及因果归属,并严格排除树差异已覆盖的变化。为确保质量,标签生成过程参考了精细设计的提示词,并经过像素证据验证,最终整合为超十万条残差样本。
特点
该数据集具有鲜明特质:规模庞大且覆盖多样,包含OSWorld全量分支与GUI-360训练全量,总计超过10万条残差记录,其中高验证比例(98%以上)确保位置可靠性。标签类型丰富,涵盖遮挡、选择、内容变化等九类,且两平台数据互补,分别擅长捕捉菜单覆盖与内容更新。此外,数据集设计巧妙,提供了无变化负样本(约7-10%)和行动效果不匹配标记,便于多角度研究。其幻影标签(placebo)版本可复现,便于因果分析。
使用方法
模型训练时,只需输入界面变更前的状态与用户操作,即可利用这些标签学习预测视觉变化。需要注意的是,`verified`标志仅代表像素位置证据,非语义精确度。使用时建议过滤`action_effect_mismatch`和空操作样本,并避免将遮挡误解为元素移除。数据集附带详尽复现文档,可从头构建训练环境,也可直接引用预构建的训练集。对于需要自定义数据生成的研究者,提供了完整的提示词和重建脚本,确保灵活适配不同学习场景。
背景与挑战
背景概述
在图形用户界面(GUI)智能体领域,构建能够预测界面状态变化的视觉世界模型(World Model, WM)是近年来的研究热点。然而,现有的无障碍树(Accessibility Tree,如AT-SPI、UIA)在表达视觉状态变化时存在结构性盲区,例如选区高亮、焦点转移、菜单遮挡、滚动或格式化等细微视觉差异,这些变化对智能体的决策至关重要,却难以从传统树结构中获取。为此,GUI Visual Delta数据集于2025年由GUI-WM团队构建,旨在通过视觉语言模型(VLM)将此类“视觉增量”进行文本化标注,弥补树结构与真实视觉状态之间的鸿沟。该数据集整合了OSWorld与GUI-360两大基准,包含逾20万条人工校验的残差记录,并提供了详尽的文档与复现指南。其影响力在于为GUI世界模型训练提供了关键的监督信号,推动了GUI智能体从静态理解向动态预测的发展。
当前挑战
该数据集面临的挑战首先源于其核心领域问题:GUI视觉状态变化的捕捉与表达。传统无障碍树忽略的视觉信息(如选中状态、菜单覆盖、渲染内容变化)具有高度动态性和多样类目,且不同平台(AT-SPI vs UIA)的树结构存在互补性缺漏,导致残差标注复杂度高。在构建过程中,挑战包括:1)需设计复杂提示词引导VLM在排除树差异的同时提取视觉残差,确保标注的纯净;2)合成标签的准确性验证依赖有限的像素变化检测机制,缺乏多轮采样或大规模语义验证,可能引入噪声;3)处理大规模数据时的效率问题,如GUI-360的35GB原始数据被压缩为轻量级训练集,需平衡信息完整性与可用性。此外,数据集还面临标签中未覆盖的重叠遮挡(occlusion)语义、部分动作引发的异常(如action_effect_mismatch)等质量陷阱,需在训练中谨慎处理。
常用场景
经典使用场景
gui-visual-delta数据集专为图形用户界面(GUI)世界模型(World Model)的训练而设计,其核心用途在于捕捉可访问性树(Accessibility Tree)未能表达的视觉状态变化。该数据集通过视觉语言模型(VLM)将屏幕截图中的动态差异——如选择状态、焦点迁移、活动标签页切换、菜单遮挡、内容渲染更新、滚动及格式变化——转化为结构化文本标签,从而为GUI智能体提供更全面的状态感知能力。研究者可基于此数据集构建能够处理非树形视觉信息的预测模型,显著提升智能体在复杂界面环境中的适应性与鲁棒性,尤其适用于需要精细视觉辨识的自动化操作任务,如软件测试、辅助技术开发及人机交互研究。
实际应用
在实际应用中,gui-visual-delta可直接赋能各类GUI自动化工具与辅助技术。例如,在软件自动化测试中,它帮助测试代理识别由菜单弹出或焦点变化引起的界面状态更新,从而更准确地模拟用户操作;在屏幕阅读器优化中,该数据集的残差标签可增强对动态内容(如富文本编辑器中的格式变化)的语音描述,提升视障用户的操作体验;同时,在RPA(机器人流程自动化)领域,基于此数据训练的世界模型能够应对非标准化界面的视觉波动,提高流程执行的稳定性与成功率。其标注结构的可迁移性也使其易于适配新场景,降低了部署成本。
衍生相关工作
该数据集衍生了一系列推进GUI智能体研究的经典工作。首先,其残差标注机制催生了‘残差预测网络’的探索,研究者尝试将树形表示与视觉残差嵌入联合训练,以增强状态表征的完备性。其次,基于其 discrimination test(判别测试)结果,后续工作发展出‘树外信息量评估基准’,用于量化不同界面下视觉信息的不可替代性。此外,书中记录的 predictability probe(可预测性探针)技术被后续研究扩展为主动感知策略,指导智能体在必要时请求视觉输入而非依赖树形数据。这些衍生工作共同构建了从数据构建到模型学习再到评估验证的完整研究链路,深刻影响了GUI世界模型的设计范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务