遇见数据集

jacob-valdez/synthux-economy-r5-w085

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5)是一个基于视觉的计算机使用轨迹数据集,由SynthUX生成。每个记录代表一个工作者在模拟公司环境中的设备会话:目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、Sheets、Slides等),观察到的轨迹被记录为屏幕视频和每个节点的帧。数据集支持应用程序原生多应用执行(无工作台覆盖)、每个参与者内容的多样性、跨操作系统消息传递以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。内容包括data.jsonl文件(每个渲染轨迹一个记录)、screenshots文件夹(每个轨迹的终端节点帧)和videos文件夹(完整屏幕录制)。记录模式涵盖轨迹ID、参与者信息、环境、目标、节点树、输入事件、观察结果、对齐信息和媒体引用。统计显示本构建包含5个轨迹、5个视频、109个帧和4家公司,环境为browser-os。数据来源为SynthUX生成,观察结果是因果性的(突变通道为低级别输入),捕获过程中未使用高级应用程序突变。

The SynthUX Computer-Use Dataset (economy sim r5) is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator applications (such as Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, etc.) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (without workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repository. Contents include data.jsonl (one record per rendered trajectory), screenshots folder (frames per terminal node for each trajectory), and videos folder (full screen recordings). The record schema includes fields like trajectory_id, actor information, environment, goal, node tree, input events, observations, alignment, and media references. Statistics for this build show 5 trajectories, 5 videos, 109 frames, and 4 companies, with environment as browser-os. Provenance indicates generation with SynthUX, where observations are causal (mutation channel is low-level input) and no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w085 数据集图片
构建方式
在数字经济与自动化交互的交叉领域中,SynthUX-economy-r5-w085 数据集通过创新的合成生成方法构建而成。每个数据记录源自模拟公司内员工的一次完整设备会话:从自然语言目标出发,系统将其逐步扩展为一棵任务节点树,终端节点通过低层级的鼠标与键盘指令驱动真实桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等),最终将观测到的交互轨迹以屏幕视频及逐节点帧图像的形式完整捕获。这一过程无需工作台叠加层,完全依托应用原生多应用执行机制,确保了交互行为的自然性与真实性。
使用方法
研究者可通过加载 data.jsonl 文件获取每个轨迹的结构化记录,包括智能体身份、组织归属、目标描述、任务节点树、密集输入事件及因果观测状态。对应的屏幕视频存放于 videos 目录下,逐节点帧图像则存储于 screenshots 目录中,便于进行视觉感知与动作序列建模。该数据集特别适用于训练与评估能够理解多应用协同操作、跨平台交互及企业级任务规划的图形用户界面智能体,亦可用于合成数据驱动的计算机使用行为分析。数据遵循 Apache-2.0 许可证,可自由用于学术与工业研究场景。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim r5) 数据集诞生于多智能体系统与图形用户界面(GUI)自动化研究的交汇点,由 SynthUX 团队于近年创建。该数据集聚焦于模拟企业环境中多个工作者通过计算机完成复杂任务的过程,旨在标准化评估和推动 GUI 代理在跨应用、多任务场景下的视觉推理与操作能力。通过记录完整的桌面操作轨迹(包括屏幕视频、按键/鼠标事件及状态快照),SynthUX 为计算机使用行为的研究提供了前所未有的细粒度、多模态基准。其模拟的多公司经济生态,使得数据不仅包含个人操作,还涵盖跨角色协作与组织间通讯,对理解现实办公环境中的自动化挑战具有重要意义,已在智能代理与交互系统领域产生广泛影响。
当前挑战
该数据集在解决两大核心挑战上具有突破性:其一,领域问题层面,现有 GUI 代理模型多局限于单一应用或预设流程,缺乏处理跨应用、多线程真实任务的能力,SynthUX 通过引入多公司经济模拟,促使模型学习在复杂工具链(如代码编辑器、通讯软件、电子表格)间切换与协调,从而应对现实办公中的非结构化和动态决策挑战。其二,构建过程中,传统数据采集依赖人工脚本或简化模拟,难以保证轨迹的因果一致性与生态多样性。SynthUX 采用无高层变异干预的因果记录方式(仅通过低层输入驱动状态变化),并精心设计不同角色、公司规模及操作系统(macOS/Windows/Browser)的组合,使得生成的 36 条轨迹在高度控制的同时仍保留自然变异性,这要求在模拟精度与数据规模之间取得精妙平衡。
常用场景
经典使用场景
SynthUX Economy R5 W085数据集为计算机使用(Computer-Use)领域的研究提供了高度仿真的多应用交互轨迹数据。该数据集模拟了一个包含多家公司的微观经济体系,其中每位员工(代理)在模拟操作系统上通过鼠标和键盘操作完成自然语言描述的工作目标,同时记录下完整的屏幕视频、逐节点截图以及底层输入事件序列。经典的使用场景包括训练和评估具备图形用户界面(GUI)操作能力的智能代理,使其能够处理跨应用协作、多步骤任务规划以及时序感知的决策问题。通过采用无工作台覆盖(no workbench overlay)的应用原生执行模式,代理需要直接操作终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等多种真实应用,从而复现人类在数字办公环境中的复杂交互行为。数据集中的每个轨迹都包含从高层目标到终端节点树的分解过程,并保留了完整的因果观测状态,使得研究者能够对代理的中间步骤进行细粒度分析和归因,为构建通用型计算机使用代理奠定了坚实的基准。
解决学术问题
该数据集有效解决了当前智能代理研究中长期存在的两个核心学术挑战:多应用环境下的长程任务规划问题以及跨平台交互的仿真真实性丢失问题。传统数据集通常局限于单一应用或受限的API调用环境,无法模拟人类在实际工作中使用的多窗口、多软件切换与协作场景。SynthUX通过引入多公司、多角色、多操作系统的模拟生态,使得代理不仅需要掌握单个应用的操作逻辑,更需理解企业级工作流中不同工具之间的数据流转与通信机制。例如,代理可能需要从邮件中提取任务、在代码编辑器中修改参数、在表格中更新数据,最终通过即时通讯工具向同事汇报结果。这样的复杂任务链对模型的记忆、推理和执行能力提出了更高要求,有助于推动以视觉为基础的语言模型或强化学习模型在现实世界数字化操作方面的泛化性能。此外,数据集通过保留低层级输入事件与因果状态对齐,为研究“规划‑执行‑观测”闭环中的错误恢复与适应性调整提供了宝贵的数据资源,使得学术界能够更系统地分析代理在遇到界面变化或意外状态时的行为鲁棒性。
实际应用
在实际工业和商业场景中,该数据集蕴含的巨大潜力体现在自动化办公助手、软件测试与用户体验优化等领域。基于该数据集训练的代理可以部署为企业级的虚拟员工,代为执行诸如客户信息录入、报表生成、跨系统数据同步等重复性高且容易出错的数字化操作,从而显著提升运营效率并降低人为差错率。例如,代理能够模拟真实员工的屏幕操作流程,自动完成在多个SaaS平台之间的数据搬运与格式转换,而无需依赖各平台提供的API接口,这对存在集成壁垒的传统企业尤为重要。同时,该数据集也适用于软件回归测试场景,通过重放录制的轨迹来验证更新后的图形界面是否依然支持预期的操作路径,进而提升自动化测试的覆盖范围。在用户体验研究方面,分析记录的低层级交互事件与响应时间有助于发现常见的误操作模式或界面设计缺陷,为开发更符合人类直觉的交互系统提供数据驱动的改进依据。多操作系统(macOS、Windows、浏览器OS)的支持进一步拓展了其在实际部署中的兼容性,使得跨平台办公自动化成为可能。
数据集最近研究
最新研究方向
该数据集聚焦于图形用户界面智能代理的前沿研究方向,通过模拟多公司经济体系中的员工设备操作轨迹,为计算机使用自动化提供高保真视觉执行数据。结合近期AI代理与自动化工作流的热点事件,其创新在于采用原生多应用执行架构(无工作台覆盖),涵盖终端、浏览器、办公协作等跨平台工具,并记录完整的低层级鼠标键盘事件与屏幕视频。这一合成数据集解决了真实场景中GUI代理训练数据稀缺的难题,推动了大语言模型驱动的多步骤任务规划与视觉定位研究,对提升数字员工、智能办公等领域的应用具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务