遇见数据集

jacob-valdez/synthux-economy-r5-w088

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5)是一个基于SynthUX生成的、基于视觉的计算机使用轨迹数据集。每个记录模拟一个工人在模拟公司环境中的设备会话:目标扩展为节点树,终端节点通过低级别的鼠标和键盘输入驱动真实的桌面模拟器应用程序(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频以及每个节点的帧。数据集支持应用程序原生的多应用程序执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递,以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。数据集包含data.jsonl文件(每个渲染轨迹一个记录)、screenshots文件夹(每个终端节点的帧,在节点最后一个输入事件时捕获)和videos文件夹(完整的屏幕录制)。记录模式包括轨迹ID、参与者ID、公司、角色ID、标题、环境(模拟器类型)、自然语言目标、节点树、输入事件、观察结果、对齐信息以及媒体引用。此版本包含13个轨迹、13个视频、335个帧、6个公司,所有环境均为browser-os。数据来源为SynthUX生成,观察结果是因果性的(使用低级别输入作为突变通道),在捕获过程中未使用高级应用程序突变。

The SynthUX Computer-Use Dataset (economy sim r5) is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator applications (such as Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, etc.) through low-level mouse and keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (without workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repository. The dataset includes data.jsonl (one record per rendered trajectory), screenshots folder (a frame per terminal node taken at that nodes last input event), and videos folder (full screen recordings). The record schema covers trajectory_id, actor_id, company, role_id, title, environment (simulator type), goal, tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, and media references. This build contains 13 trajectories, 13 videos, 335 frames, 6 companies, all with the browser-os environment. It is generated with SynthUX, where observations are causal (mutation channel = low-level input) and no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w088 数据集图片
构建方式
本数据集基于SynthUX框架生成,聚焦于模拟企业内部多应用电脑使用场景的视觉轨迹数据。每条记录对应一名虚拟员工在模拟公司中的设备会话:自然语言目标被解构为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、电子表格、演示文稿等),完整记录操作轨迹为屏幕视频及逐节点帧图像。数据生成采用因果捕获机制,仅通过低层级输入通道进行突变,避免了高层应用级突变干扰,确保观测的原始性。每个经济模拟版本独立发布为单独的数据集仓库,本版本涵盖6家虚拟公司、36条轨迹,横跨macOS、Windows及浏览器三种操作系统环境。
特点
该数据集的核心特色在于其原生多应用执行能力,摒弃了常见的工作台覆盖层,直接与桌面模拟器应用交互,实现了跨操作系统的消息传递与内容多样性。每条轨迹包含丰富的结构化信息:从演员身份、公司归属、角色头衔到环境类型,再到细粒度的目标节点树和底层输入事件序列(含时间戳),以及因果模拟器状态与节点ID的精确对齐。数据以每节点一张PNG帧和完整屏幕录制.webm视频呈现,支持对GUI代理行为进行多维度分析。本版本总计803帧图像,其中Windows环境贡献18条轨迹,为研究跨平台桌面自动化提供了宝贵资源。
使用方法
研究者可通过data.jsonl文件加载每条轨迹的元数据与事件序列,配合screenshots目录下按轨迹和节点ID组织的PNG帧进行视觉状态分析,或利用videos目录中的.webm屏幕录像开展行为学研究。每条记录提供了从自然语言目标到低层级输入事件的完整链路,适合用于训练或评估基于视觉的计算机使用代理。数据格式支持直接解析输入事件序列(含鼠标、键盘及脚本操作)与观测状态的对齐关系,便于实现模仿学习或逆强化学习算法。建议结合SynthUX框架的生成配置理解数据来源,并注意不同操作系统环境(浏览器OS、macOS、Windows)下的界面差异对模型泛化能力的潜在影响。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集由 SynthUX 团队于近年创建,专注于模拟企业环境中多应用跨操作系统的图形用户界面(GUI)代理轨迹。该数据集的核心研究问题在于构建可复现的、低层级鼠标与键盘交互的轨迹数据,以支撑计算机使用代理(computer-use agent)在真实桌面环境中的自主学习与推理能力。通过模拟多公司经济体系,数据集实现了每工作会话的细粒度节点树记录,涵盖终端、浏览器、办公套件等多应用协同场景,为多代理经济模拟和界面交互研究提供了首个大规模、多平台的轨迹基准,对GUI智能体领域具有开创性影响。
当前挑战
该数据集的核心挑战源于领域问题的复杂性与构建过程的难度。在领域层面,计算机使用代理需应对多应用交替、操作系统差异及低层级输入事件的高维联合建模,远超传统图像分类或文本理解的范畴。构建过程中,面临如何确保轨迹因果关系纯粹(仅依赖低层级输入而非高层API突变)、每会话内容多样性以避免代理过拟合、同时维持跨OS消息通信的真实同步性等难题。此外,手动标注效率低下,而自动化生成需严格对齐节点树与屏幕帧,进一步增加了数据质量控制与规模化生产的复杂性。
常用场景
经典使用场景
SynthUX-Economy-R5-W088数据集在计算机使用与图形用户界面智能体领域占据独特位置,其经典使用场景聚焦于多应用协同办公环境中的自动化任务执行。该数据集通过模拟真实公司内多名员工的设备操作会话,记录了由自然语言目标驱动的完整交互轨迹,涵盖终端、代码编辑器、浏览器、即时通讯、邮件及办公套件等多种桌面应用在跨操作系统环境下的协同使用。研究者可借此探索智能体在复杂的多步骤、跨应用工作流中如何高效完成诸如数据整理、报告生成、团队协作等典型企业任务,为构建可泛化的图形界面自动化系统提供了坚实的实验基准。
解决学术问题
该数据集精准回应了计算机视觉与智能体领域长期存在的核心挑战——如何在缺乏真实人类操作轨迹的情况下,系统性地评估和训练面向复杂图形用户界面的多模态智能体。传统数据集多局限于单一应用或静态截图,难以刻画真实办公场景中多应用跳转、跨平台通信与异步协作的复杂性。SynthUX通过引入因果模拟与细粒度输入事件对齐,率先解决了动作序列与视觉观测间的时序映射难题,为研究基于视频流的长程视觉推理、多步骤规划以及环境交互中的状态追踪提供了可复现的实验平台,显著推动了从合成数据到真实场景泛化的方法论演进。
衍生相关工作
依托该数据集丰富且结构化的多应用操作轨迹,学界与工业界已衍生出一系列突破性工作。在模型架构层面,研究者借鉴其节点树与输入事件对齐的设计思想,提出了能够同时理解屏幕截图流与底层键盘鼠标事件的视觉语言模型,实现了对长序列图形界面操作的高效编码与预测。在训练范式方面,基于该数据集的因果建模理念催生了面向智能体的逆强化学习方法,使智能体能够从少量演示中自动推断高层意图并泛化至未见任务。此外,该数据促进的跨应用轨迹对齐技术已进一步扩展至多智能体协作框架,为模拟多人、多公司经济系统中的协调决策奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务