遇见数据集

spine

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集名为“GUI World Model — Spine Transitions”,收集了在 Ubuntu 桌面环境中执行任务指令时产生的 (s, a, s') 转移数据。每个状态包含运行时截图(PNG 格式)、可访问性树(XML 格式)以及模型读取的渲染元素表(AgentWorldBench 格式 A 表:标签、名称、文本、类、描述、位置和尺寸)。数据集仅包含 agent 实际走过的“主干”路径,不包含分支。指令来源包括:agentnet(从人类录制中提取指令,但轨迹由 agent 自身生成)、osworld(369 个 OSWorld 任务指令,由 agent 执行)以及 synthesized(由 Qwen3.8-27B 基于收集的转移数据生成,经过 11 项筛选)。agent 为 OpenCUA-7B,桌面环境为 OSWorld 的 Ubuntu 虚拟机(1920×1080)。数据列包括:instruction_source(指令来源)、trajectory_source(轨迹来源:agent 或 replay)、transition_role(角色:main 或 branch)、walk_pass(行走轮次)、config_id(配置 ID)、policy_model(策略模型)、synth_source_task_id(合成指令的源任务 ID)、duplicate_of(重复标记)以及状态前后截图、可访问性树和文本表示。数据预处理:移除导致两个不同后继状态的 (s, a) 对(避免错误确定性),保留重复的 (s, a, s') 并标记为 duplicate_of(用于构建完整轨迹),保留约四分之一不发生变化的转移(反映界面不变性)。数据集规模为 10K 到 100K 样本,以 Parquet 格式存储,并可恢复为每步八文件的原始目录结构。适用于训练 GUI 世界模型、桌面 agent 的规划与决策等任务。

The dataset is named GUI World Model — Spine Transitions, collecting (s, a, s) transition data generated from executing task instructions in the Ubuntu desktop environment. Each state includes a runtime screenshot (PNG format), an accessibility tree (XML format), and a rendering element table read by the model (AgentWorldBench format A table: label, name, text, class, description, position, and size). The dataset contains only the spine paths actually traversed by the agent, without branches. Instruction sources include: agentnet (instructions extracted from human recordings but trajectories generated by the agent itself), osworld (369 OSWorld task instructions executed by the agent), and synthesized (generated by Qwen3.8-27B based on collected transition data, with 11 filters). The agent is OpenCUA-7B, and the desktop environment is an OSWorld Ubuntu virtual machine (1920×1080). Data columns include: instruction_source, trajectory_source (agent or replay), transition_role (main or branch), walk_pass, config_id, policy_model, synth_source_task_id, duplicate_of, and pre/post-state screenshots, accessibility trees, and text representations. Data preprocessing: remove (s, a) pairs leading to two different successor states (to avoid erroneous determinism), retain duplicate (s, a, s) and mark as duplicate_of (for building complete trajectories), and keep approximately one quarter of transitions that do not change (reflecting interface invariance). Dataset size ranges from 10K to 100K samples, stored in Parquet format, and can be restored to the original directory structure of eight files per step. It is suitable for training GUI world models, planning and decision-making for desktop agents, etc.

创建时间:
2026-08-21
原始信息汇总

GUI World Model — Spine Transitions 数据集

数据集概述

该数据集包含通过在实际运行的 Ubuntu 桌面上执行任务指令收集的 (s, a, s) 转换数据。每个状态都从运行中的机器捕获:截图、可访问性树(XML 格式)以及模型读取的渲染元素表。数据集中仅包含主干路径(agent 实际执行的路径),不包含分支。

基本信息

  • 许可证:Apache-2.0
  • 语言:英语
  • 任务类别:其他(GUI / 世界模型 / 桌面 / Agent / Ubuntu)
  • 数据集规模:10K < n < 100K
  • 数据格式:Parquet 文件(data/*.parquet
  • 默认配置default

指令来源

来源 描述
agentnet 来自人类使用自己桌面时的录音(xlangai/AgentNet),仅提取指令部分;轨迹为本数据集生成。Windows 和 macOS 录音在任务可移植时包含,应用程序名称会被重写(如 ExcelLibreOffice Calc),且无法对应功能的任务会被拒绝。
osworld 369 个 OSWorld 任务指令,由 agent 执行而非重放。
synthesized 由 Qwen3.8-27B 根据收集的转换数据编写,通过十一项检查筛选。

执行 Agent:OpenCUA-7B 全程使用。 桌面环境:OSWorld 的 Ubuntu 虚拟机,分辨率 1920×1080。

关键列说明

列名 取值/说明
instruction_source agentnet · osworld · synthesized
trajectory_source agent(模型选择动作)· replay(重放录音)
transition_role main(主干上)· branch(分支)
walk_pass 产生该数据的任务列表遍历轮次
config_id 任务遍历的生成起始状态标识
policy_model 选择动作的模型
synth_source_task_id 合成指令所源自的 OSWorld 任务
duplicate_of 重复转换的关联标识

状态列

  • before_screenshot / after_screenshot:PNG 字节
  • before_a11y_xml / after_a11y_xml:可访问性树 XML
  • before_a11y_txt / after_a11y_txt:可访问性树文本
  • before_awb_txt / after_awb_txt:AgentWorldBench 格式 A 表格(标签 · 名称 · 文本 · 类 · 描述 · 位置(左上角 x&y)· 尺寸(宽&高))

数据筛选与标记策略

已移除:同一 (s, a) 导致两个不同 s 的转换。基于 700 条轨迹样本测量发现 111 组此类情况,例如打开 Thunderbird 有时显示欢迎页面有时不显示。保留任一分支都会错误地教授桌面环境中不存在的确定性,因此全部移除。

仅标记未删除:重复的 (s, a, s)。重复通常源于共享起始状态(多个任务引导到同一应用的同一起始屏幕)。删除重复项会破坏生成它们的完整轨迹链,因此保留行并标记 duplicate_of。在单条转换训练时可过滤;在构建历史轨迹时忽略该标记。

保留有意的:表格未变化的转换(约占四分之一)。无变化的动作本身是界面的事实,模型若从未见过此类转换会错误地认为每个动作都会带来变化。

数据恢复说明

Parquet 文件是交付格式,非有损格式。使用 guiwm_collector.dataset.pack.materialize() 可逐字节恢复八文件每步的目录树结构,已在完整轨迹上验证:176 个文件全部一致。

搜集汇总
数据集介绍
spine 数据集图片
构建方式
在图形用户界面智能体与世界模型研究领域,真实桌面环境下的状态转移数据是训练与评估模型的核心资源。该数据集的构建依托OSWorld提供的Ubuntu虚拟机,以1920×1080分辨率运行于真实桌面,由OpenCUA-7B智能体依据三类任务指令逐步执行操作,从而采集\((s, a, s')\)转移序列。指令来源涵盖AgentNet中人类使用自有桌面的录制(仅取其指令,轨迹由智能体重新生成)、OSWorld的369条任务指令,以及由Qwen3.8-27B基于已有转移经十一项校验门控合成的指令。每个状态均从运行中的机器实时捕获,包括截图、无障碍树XML及渲染元素表,并且仅保留智能体实际行走的主干路径,不记录分支。
特点
该数据集在结构与标注层面均体现出对真实交互不确定性的尊重。状态字段完整涵盖操作前后的截图PNG字节、无障碍树XML与文本表示,以及AgentWorldBench格式A的元素表,后者记录标签、名称、文本、类、描述、位置与尺寸等信息。元数据列如instruction_source、trajectory_source、transition_role等明确标识数据来源与生成方式,避免以内部流水线名称混淆语义。针对同一\((s, a)\)到达不同\(s'\)的情形,因桌面环境本身存在非确定性,数据集选择将其剔除;而对重复出现的\((s, a, s')\),则以duplicate_of标注而非删除,以保持轨迹完整性;约四分之一不引起界面变化的转移被有意保留,以令模型习得并非所有动作都会改变界面这一事实。
使用方法
数据集以Parquet文件形式交付,用户可通过HuggingFace datasets库直接加载data目录下的文件。在训练单个转移时,可依据duplicate_of字段过滤重复行;在构建完整历史序列时,则应忽略该字段,因每个AgentWorldBench样本均由其整条从根到叶的链构成,缺失早期步骤会导致后续步骤被误作单轮样本。若需还原原始目录结构,可调用guiwm_collector.dataset.pack.materialize()方法,将每步对应的八个文件逐字节写回目录树,经完整轨迹验证,176个文件可完全一致地恢复。
背景与挑战
背景概述
图形用户界面世界模型旨在赋予智能体预测动作后果的能力,其核心在于对桌面交互过程进行可复现、可审计的建模。Spine数据集由相关研究团队于构建AgentWorldBench的进程中采集,依托OpenCUA-7B策略模型与OSWorld的Ubuntu虚拟机环境,将AgentNet人类指令与OSWorld任务清单在真实桌面上逐步执行,记录约万级至十万级的(状态、动作、后继状态)转换。数据集聚焦智能体实际行经的主干路径,摒弃分支探索,并附有无障碍树与可读元素表,为GUI世界模型的训练与评测提供了贴近真实系统的结构化素材。
当前挑战
该数据集所应对的领域难题在于,桌面环境的动态性使相同动作可能抵达迥异的后继状态,模型极易习得虚假的确定性。构建过程中的主要挑战包括:同一(状态、动作)对应多个后继状态时无从判定何者为偶发,只能整组剔除;跨任务共享初始界面导致转换重复,删除会破坏轨迹完整性,因而仅作标记;界面元素表无变化的状态转换约占四分之一,若一概清理则模型将误认为动作必改变界面。这些取舍在保真与完整之间持续构成张力。
常用场景
经典使用场景
在图形用户界面智能体的研究领域中,世界模型旨在刻画智能体与桌面环境交互时的状态演化规律,而Spine数据集恰为这一方向提供了高质量的序贯经验素材。该数据集通过OpenCUA-7B智能体在真实Ubuntu虚拟机中执行任务指令,逐步骤采集了状态转移三元组(s, a, s'),每一状态均包含截图、无障碍树XML以及渲染元素表三种模态表示。其最为经典的使用场景在于训练和评估基于视觉与结构信息的GUI世界模型,使模型能够依据当前界面状态与候选动作预测下一状态,从而在复杂的桌面操作环境中实现前瞻性规划与决策模拟。
解决学术问题
长期以来,GUI智能体研究面临真实交互轨迹稀缺、状态转移不确定以及跨平台泛化困难等学术瓶颈。Spine数据集以真实运行机器上采集的完整状态表示为基础,明确区分了主路径转移与分支转移,并对重复转移和不确定单向映射进行了细致标注与处理,有效回应了确定性建模假设与实际界面随机性之间的矛盾。它既可用于世界模型的动态预测研究,也为动作条件生成、状态表征学习与轨迹建模提供了可复现的数据支撑,推动了该领域从依赖模拟环境向基于真实桌面的经验学习范式转变。
衍生相关工作
Spine数据集在构建过程中吸收了AgentNet与OSWorld等既有工作的任务指令,并采用OpenCUA-7B作为动作策略模型,形成了与这些经典工作紧密关联的衍生脉络。围绕该数据集,研究者可进一步开展基于世界模型的规划算法、多模态状态编码器以及轨迹增强方法等后续探索。其关于重复转移、状态不变化转移与不确定转移的处理策略,也为后续数据集构建与评测协议设计提供了可借鉴的方法论参考,对GUI智能体领域的数据生态建设具有承前启后的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务