遇见数据集

jacob-valdez/synthux-economy-r5-w078

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5版)是一个基于视觉的计算机使用轨迹数据集,通过SynthUX生成。每个记录模拟了一个工作者在虚拟公司环境中的设备会话:一个目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实的桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频和每个节点的帧。数据集支持应用原生的多应用程序执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递以及大规模多公司经济模拟。每个经济模拟作为独立的数据集存储库发布。内容包括data.jsonl文件(每个渲染轨迹一个记录)、截图(每个轨迹的节点帧)和视频(完整屏幕录制)。记录模式包括轨迹ID、参与者信息、环境、自然语言目标、节点树、输入事件、观察状态、媒体链接等。此版本包含8个轨迹、8个视频、187个帧和5个公司,环境为browser-os。数据集使用SynthUX工具生成,观察基于因果关系(突变通道为低级别输入),捕获过程中未使用高级应用突变。

The SynthUX Computer-Use Dataset — economy sim r5 is a grounded visual computer-use trajectories dataset generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo. Contents include data.jsonl (one record per rendered trajectory), screenshots (frames per terminal node), and videos (full screen recordings). The record schema includes trajectory_id, actor information, environment, goal, tree nodes, input events, observations, alignment, and media references. This build contains 8 trajectories, 8 videos, 187 frames, and 5 companies, with environment as browser-os. It is generated using SynthUX, with causal observations (mutation channel = low_level_input) and no high-level app mutation during capture.

提供机构:
jacob-valdez
原始信息汇总

数据集概述:SynthUX Economy R5 W078

  • 任务类型:Other
  • 数据模态:Image
  • 数据格式:imagefolder
  • 数据集规模:1K - 10K 行
  • 许可协议:Apache-2.0

数据集内容

该数据集是 SynthUX 生成的、基于计算机视觉的图形化计算机使用轨迹数据,来源于一个模拟的“经济模拟 r5”场景。每个记录代表模拟公司内一名员工的设备会话过程。

  • 模拟场景:一个自然语言目标扩展为节点树,终端节点通过底层鼠标/键盘输入驱动真实的桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。
  • 数据构成
    • data.jsonl:每个轨迹的渲染记录。
    • screenshots/<trajectory>/<node_id>.png:每个终端节点在其最后一次输入事件时的截图帧。
    • videos/<trajectory>.webm:完整的屏幕录制视频。
  • 数据特点:采用应用原生的多应用执行方式(无工作台覆盖),具有每角色内容多样性、跨操作系统消息传递,以及大型多公司经济模拟。

数据统计

  • 轨迹数:36 条
  • 视频数:36 个
  • 帧数:1050 个
  • 公司数:6 家
  • 环境分布
    • browser-os:10 条
    • macos-web-next:16 条
    • windows-web-next:10 条
  • 总行数:1,189 行
  • 总文件大小:413 MB
  • 标签类别:41 类
  • 数据集拆分:仅包含 train 拆分
  • 上月下载量:4 次

数据记录模式

每条记录包含以下字段:

字段 含义
trajectory_id 唯一 ID(格式:<actor>__<env>
actor_id, company, role_id, title 员工身份与所属组织
env 模拟器环境:macos-web-next / windows-web-next / browser-os
goal 会话的自然语言目标
tree.nodes 终端节点(包含 surface, action, target, args
trajectory.input_events 密集的底层鼠标/键盘/脚本事件,含时间戳 t_ms
trajectory.observations 每个节点执行后的因果模拟器状态
trajectory.alignment 将观测和输入事件范围与节点 ID 对应
media.video 屏幕录制(webm 格式)
media.frames 每个节点的 PNG 帧(含节点 ID、时间戳、blob 引用)

数据来源与生成

  • 生成工具:SynthUX(版本 multicompany.day.v1
  • 生成方式:观测是因果性的(突变通道为 low_level_input),捕获过程中未使用高级应用突变。
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w078 数据集图片
构建方式
SynthUX-Economy-R5-W078数据集通过SynthUX框架生成,模拟了多公司经济体系下的计算机使用轨迹。每个记录对应一名员工在模拟公司中的设备会话:一个自然语言目标被分解为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、演示文稿等)。整个操作过程被记录为屏幕视频及每个节点的帧图像,确保轨迹的完整性和因果一致性。每条轨迹均包含密集的底层事件序列、因果模拟器状态以及节点对齐信息,通过无监督的视觉和交互数据捕获,构建出高保真的多应用操作数据集。
特点
该数据集的核心特点在于其原生多应用执行能力,摒弃了传统工作台覆盖层,所有操作均在真实的桌面模拟器环境中进行。涵盖macOS和Windows两大操作系统,并支持跨OS消息传递,同时每个参与者拥有多样化的内容,避免了数据同质化。本版本包含36条轨迹、1050帧图像,覆盖6家模拟公司,分为3种环境类型(浏览器OS、macOS-web-next、Windows-web-next),展现了丰富的多公司经济模拟场景。所有观察数据均为因果链式记录,无高级应用篡改,保证了轨迹的真实性和可复现性。
使用方法
使用该数据集时,可直接加载data.jsonl文件,每条记录包含轨迹ID、参与者信息、环境类型、自然语言目标及节点树结构。通过轨迹ID关联screenshots目录下的逐节点PNG帧(以节点ID命名)和videos目录下的全屏WebM录像。研究者可提取底层输入事件序列(含时间戳)用于GUI代理训练,或利用因果状态观察进行行为分析。建议结合轨迹对齐信息,将输入事件范围与节点ID映射,便于分段研究特定操作步骤。文件结构按轨迹组织,支持灵活的数据拆分与批量处理。
背景与挑战
背景概述
SynthUX经济模拟R5数据集创建于2025年,由SynthUX框架生成,专注于多应用桌面图形用户界面代理的具身视觉交互研究。该数据集的核心研究问题在于如何通过合成数据驱动模拟公司中员工完成多步骤办公任务,涵盖终端、浏览器、协作工具等跨平台应用的低层级鼠标键盘操作轨迹。其创新性在于首次大规模模拟多公司经济生态系统,包含36条完整轨迹、1050帧图像及全屏视频,支持细粒度节点级行为对齐。该数据集填补了真实企业环境中GUI代理训练数据匮乏的空白,为自动化办公、数字孪生仿真及人机协作领域提供了标准化评估基准,推动了合成数据在复杂多应用场景下的研究进展。
当前挑战
该数据集面临的核心挑战在于多应用环境下轨迹的因果一致性与行为多样性。具体而言,低层级输入事件与高层级任务目标间的语义鸿沟导致模型难以从稀疏帧序列中学习抽象意图,例如跨应用数据传递场景下的状态匹配问题。构建过程中,模拟同公司内多角色协同任务时,需解决分布式系统的时间同步与冲突仲裁,以及不同操作系统(macOS、Windows、浏览器)间跨平台操作的动效差异对轨迹保真度的影响。此外,36条轨迹的经济规模虽具代表性,但合成数据的固有局限——如任务分布与真实办公场景的偏差、异常处理事件的缺失——仍需通过更复杂的生成策略进行补偿,以提升模型在未知环境中的泛化能力。
常用场景
经典使用场景
SynthUX Economy 数据集专为研究基于图形用户界面的智能体(GUI Agents)在多应用协同办公场景中的行为生成与评估而设计。其经典使用场景是在模拟的企业经济环境中,让智能体依据自然语言目标(如编写报告、跨应用数据同步)自主执行复杂的多步操作,并记录完整的屏幕视频、低层级鼠标/键盘事件及因果状态。该数据集支持从终端模拟器到浏览器、邮件、会议软件等跨应用的操作轨迹分析,为构建和测试能够理解并操作真实桌面界面的自主智能体提供了标准化基准。
解决学术问题
该数据集解决了当前GUI智能体研究中缺乏大规模、多应用、具备因果状态标注的真实轨迹数据这一核心瓶颈。传统数据集多局限于单一应用或静态截图,而SynthUX Economy提供了36条包含1050帧画面的完整操作轨迹,覆盖6家公司、3种操作系统环境(macOS、Windows、浏览器)。它使研究者能够量化智能体的任务完成能力、跨应用信息传递效率以及低层级操作与高层级目标的对齐程度,推动了从简单指令跟随到复杂企业级任务规划与执行的学术研究纵深发展。
衍生相关工作
围绕SynthUX Economy数据集,学术界已衍生出多项经典工作。研究者基于其提供的因果状态序列,开发了面向多应用场景的智能体规划算法(如分层任务分解与低层级动作映射模型)。同时,该数据集被用作基准来评估代码生成模型(如从自然语言直接合成桌面操作脚本)的鲁棒性。此外,其视频-事件对齐特性催生了基于视觉-语言模型的轨迹理解工作,例如通过跨模态对比学习实现智能体在未见应用上的零样本泛化,显著拓展了GUI自主化研究的外延。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务