遇见数据集

jacob-valdez/synthux-economy-r2-w007

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集——经济模拟r2是一个由SynthUX生成的基于视觉的计算机使用轨迹数据集。每个记录代表一个工人在模拟公司内的设备会话:目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实桌面模拟器应用(包括Terminal、Notes、VS Code、Browser、Slack/Teams、Mail、Sheets、Slides等),观察到的轨迹被记录为屏幕视频加上每个节点的帧。该数据集支持应用原生多应用程序执行(无工作台覆盖),每个参与者内容多样性,跨操作系统消息传递,以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。数据集包含data.jsonl文件(每个渲染轨迹一条记录)、screenshots目录(每个轨迹和节点的PNG帧,在节点最后一个输入事件时捕获)和videos目录(完整屏幕录制的webm视频)。记录模式包括trajectory_id、actor_id、company、role_id、title、env、goal、tree.nodes、trajectory.input_events、trajectory.observations、trajectory.alignment、media.video和media.frames等字段。统计信息显示本版本包含36个轨迹、36个视频、945个帧、6个公司,按环境分类:browser-os(7个)、macos-web-next(19个)、windows-web-next(10个)。数据来源于SynthUX生成,观察是因果性的(突变通道为低级别输入),捕获过程中未使用高级别应用突变。

SynthUX Computer-Use Dataset — economy sim r2 is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo. The dataset includes data.jsonl (one record per rendered trajectory), screenshots directory (PNG frames per trajectory and node, taken at that nodes last input event), and videos directory (full screen recordings in webm format). The record schema comprises fields such as trajectory_id, actor_id, company, role_id, title, env, goal, tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, media.video, and media.frames. Statistics for this build show 36 trajectories, 36 videos, 945 frames, 6 companies, and breakdown by env: browser-os (7), macos-web-next (19), windows-web-next (10). Provenance indicates generation with SynthUX, with causal observations (mutation channel = low_level_input) and no high-level app mutation used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r2-w007 数据集图片
构建方式
该数据集源于SynthUX框架,旨在生成基于视觉的计算机操作轨迹,适用于模拟公司环境中的多应用协同场景。构建过程始于一个自然语言描述的目标,该目标被逐步细化为节点树,终端节点通过低层级的鼠标与键盘输入驱动真实的桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、即时通讯工具、办公软件等)。每个操作会话中,一个虚拟员工在模拟公司内的设备操作被完整记录,形成包含屏幕视频与逐节点帧的轨迹数据。每条轨迹对应一个工作会话,其构建机制确保了操作的因果性——输入事件序列与模拟器状态变化严格对应,未采用任何高层应用层变异手段进行干预,从而保证了数据的真实性与可复现性。
特点
该数据集的核心特点在于其高度的生态仿真能力与多应用交互的复杂性。通过模拟拥有多个公司的经济体,每个会话中员工执行的任务涉及跨操作系统(macOS、Windows、浏览器)的消息传递与多应用同时操作,摒弃了传统工作台覆盖层,实现了应用原生级别的交互多样性。数据集包含36条轨迹与945个帧图像,分布在不同操作系统环境中,其中macOS环境占比最高。每条轨迹不仅记录密集的低层级输入事件与时间戳,还提供了因果状态观察与帧对齐信息,使得研究者能够精细化地分析操作序列与界面反馈之间的动态关系。其多公司、多角色、多目标的设定,为评估GUI代理在真实商业场景中的泛化能力提供了独特资源。
使用方法
数据集以标准JSON Lines格式存储,每条记录对应一个完整的操作轨迹,可通过简单的文件读取与解析快速加载。使用时可依据轨迹ID、员工身份、公司归属或操作系统环境进行筛选,以适配不同的研究需求。对于专注于视觉代理训练的任务,可直接利用提供的屏幕视频与逐节点帧图像作为输入,配合节点树中的动作标签进行监督学习。轨迹中的输入事件序列与状态观察数据可用于构建时间序列模型或推理增强的代理系统。此外,跨应用与跨系统的轨迹设计支持多任务迁移学习实验,研究者可基于公司或环境维度划分训练集与测试集,评估模型在未见场景中的适应能力。
背景与挑战
背景概述
SynthUX-economy-r2-w007 数据集由 SynthUX 项目于近期创建,旨在为图形用户界面(GUI)智能体研究提供高度真实的计算机使用轨迹数据。该数据集由多机构研究团队联合开发,核心研究问题聚焦于如何通过仿真多公司经济环境,生成涵盖多应用协同操作的低层级输入事件序列,以推动 GUI 智能体在真实办公场景中的泛化能力。通过模拟公司内部员工的设备操作,数据集记录了从自然语言目标到节点树展开,再到终端节点驱动桌面模拟器应用(如终端、浏览器、办公软件等)的完整过程,并同步捕获屏幕视频与逐帧截图。这一创新设计不仅为 GUI 智能体训练提供了丰富的多任务、多环境、多操作系统数据,还显著提升了仿真数据的生态多样性与因果一致性,对推动自主计算机交互、任务规划与执行等领域的研究具有重要影响力。
当前挑战
该数据集所应对的领域问题主要涵盖两方面。其一,传统 GUI 智能体依赖单一应用或预定义工作流,缺乏在动态多应用、跨操作系统环境下的泛化能力,而 SynthUX 通过模拟真实经济系统中的员工协作(如邮件、即时通讯、文档处理等交错任务),精准聚焦于跨应用多步操作的领域挑战,尤其强调低层级输入的真实性与因果链的完整性。其二,在数据集构建过程中,技术挑战显著:如何在不依赖高层面板覆盖(workbench overlay)的前提下,实现应用原生的多应用执行控制;如何确保每个演员(actor)在生成轨迹时保持内容多样性,避免场景单一;以及如何跨 macOS 和 Windows 模拟器统一采集格式并同步状态,均需精细的底层输入通道设计与大规模仿真编排。这些挑战的克服,使得数据集在轨迹质量、规模与复杂度上达到新高度,为后续研究提供了坚实的数据基础。
常用场景
经典使用场景
SynthUX Economy R2 W007数据集为计算机使用(Computer-Use)领域的研究者提供了一套极具价值的仿真经济场景轨迹数据。该数据集的经典用法在于,研究者可利用其丰富的GUI代理(GUI Agent)交互记录,探索如何在模拟的多公司协作环境中部署和评估能够执行复杂办公任务的自主智能体。每一条轨迹都记录了员工在真实桌面模拟器(涵盖终端、笔记、VS Code、浏览器、邮件及即时通讯等应用)上的完整操作链路,从自然语言目标到底层鼠标键盘事件,为构建、训练和评测能够跨应用执行多步骤任务的计算代理提供了高精度、带视频帧标注的标准化基准。
解决学术问题
在学术研究领域,该数据集着力解决了制约GUI智能体发展的两大核心问题:多应用协同操作的泛化瓶颈与复杂企业场景的模拟缺失。长期以来,研究者受限于单一应用环境下的数据集,难以验证智能体在实际企业信息化系统中的跨平台、跨应用协作能力。本数据集通过构建包含6家虚拟公司、36条完整轨迹和945帧标注的仿真经济生态,首次提供了涵盖多操作系统(macOS、Windows、浏览器OS)与多应用交互的真实案例,使得学术界能够系统性地研究智能体在长尾任务执行中的轨迹对齐、异常恢复及策略泛化问题,极大地推动了自主计算代理从实验室原型向真实部署的学术跨越。
衍生相关工作
围绕SynthUX Economy R2 W007数据集的衍生工作,正逐步在计算机视觉与智能体交叉领域催生出多个前沿研究方向。由于数据提供了每帧截图的像素级记录与底层事件的时间戳对齐标注,研究者已开始利用其进行视觉语言模型(VLM)的细粒度动作推理训练,探索从屏幕图像序列直接预测下一步操作的可能性。与此同时,该数据集中自然语言目标与密集动作序列的对应关系,也启发了许多学者开展轨迹级强化学习策略蒸馏工作,尝试将专家演示的复杂策略压缩至轻量级多模态模型中,以期实现低延迟的端到端桌面控制。此外,跨应用状态追踪与因果推断方法的实证研究也在此数据集上得到了充分的验证与拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务