遇见数据集

jacob-valdez/synthux-economy-r5-w018

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5)是一个基于SynthUX生成的视觉计算机使用轨迹数据集,用于模拟公司环境中的员工设备会话。每个记录代表一个轨迹,其中目标扩展为节点树,终端节点通过底层鼠标和键盘输入驱动真实的桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。观察到的轨迹被记录为屏幕视频和每个节点的帧。数据集支持应用原生多应用程序执行(无工作台覆盖),具有每个参与者内容多样性、跨操作系统消息传递和大规模多公司经济模拟特性。每个经济模拟作为独立的数据集仓库发布。数据集包含data.jsonl(每个渲染轨迹的记录)、screenshots目录(每个终端节点的帧,以PNG格式存储)和videos目录(完整屏幕录制,以WebM格式存储)。记录模式包括轨迹ID、参与者ID、公司、角色、标题、环境(模拟器类型)、目标(自然语言会话目标)、节点树、输入事件、观察结果、对齐信息以及媒体文件(视频和帧)。统计信息显示:本版本包含36个轨迹、36个视频、920个帧、6家公司,环境分布为browser-os(6)、macos-web-next(9)和windows-web-next(21)。数据集由SynthUX生成,观察结果是因果性的(突变通道为底层输入),在捕获过程中未使用高级应用突变。

The SynthUX Computer-Use Dataset — economy sim r5 is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (such as Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, etc.) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. The dataset features app-native multi-application execution (without workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repository. Contents include data.jsonl (one record per rendered trajectory), screenshots directory (a frame per terminal node stored as PNG), and videos directory (full screen recording in WebM format). The record schema includes fields like trajectory_id, actor_id, company, role_id, title, env (simulator type), goal (natural-language goal for the session), tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, and media files (video and frames). Statistics for this build show: 36 trajectories, 36 videos, 920 frames, 6 companies, with environment distribution as browser-os (6), macos-web-next (9), and windows-web-next (21). The dataset is generated with SynthUX, where observations are causal (mutation channel is low-level input), and no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w018 数据集图片
构建方式
SynthUX-Economy-R5-W018数据集基于多智能体经济仿真框架构建,记录模拟公司中每位员工的设备操作轨迹。每条数据始于一个自然语言目标,该目标被扩展为节点树,终端节点通过底层鼠标与键盘输入驱动真实桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、电子表格与演示文稿等)。整个执行过程不依赖工作台覆盖层,而是采用应用原生的多应用并发机制,最终将观测到的轨迹以屏幕视频和每节点关键帧的形式加以保存。
特点
本数据集具有显著的生态多样性特征,涵盖6家模拟公司、36条完整轨迹及920帧节点图像。每条轨迹包含密集的底层输入事件序列、因果模拟器状态快照以及输入事件与节点之间的精确对齐信息。数据集的构建基于低层输入层面的因果突变通道,摒弃高层应用突变,确保了观测结果的真实性与因果一致性。此外,数据覆盖macOS、Windows及浏览器三种操作系统环境,并包含跨应用消息传递与多公司经济活动的丰富交互场景。
使用方法
研究人员可通过加载data.jsonl文件解析每条轨迹的结构化记录,包括参与者身份、组织归属、目标描述及节点树信息。screenshots目录下按轨迹与节点标识符组织PNG帧图像,可用于视觉状态提取与模型训练。videos目录中的WebM格式屏幕录制则适用于时序动作理解与接口行为分析。数据集的低层输入事件序列与对齐信息支持细粒度的GUI代理行为建模,可应用于多应用协同操作、因果推断及仿真环境下的智能体策略学习等方向。
背景与挑战
背景概述
SynthUX-economy-r5-w018数据集由SynthUX团队于近期构建,旨在生成基于视觉的计算机使用轨迹,以模拟真实工作场景中的多应用协同操作。该数据集聚焦于企业经济运行模拟环境,通过将自然语言目标分解为节点树,驱动终端节点在桌面模拟器(如终端、VS Code、浏览器、 Slack等)中执行低层级鼠标和键盘操作,并记录完整的屏幕视频与逐帧图像。作为多公司经济模拟的一部分,该数据集为GUI代理研究提供了高保真、原生应用执行轨迹,尤其填补了跨操作系统消息传递与多应用交互场景的空白,对自动化办公、用户界面智能代理等领域具有重要推动价值。
当前挑战
该数据集面临的核心挑战在于:1) 领域问题方面,现有计算机使用数据集多局限于单一应用或高抽象层级操作,难以支撑复杂企业经济模拟中的多应用、跨系统协同任务,而SynthUX需通过低层级输入事件模拟真实用户行为,对代理的泛化能力提出更高要求;2) 构建过程中,需保证每个经济模拟公司内不同角色(如actor、company)的内容多样性,同时维持每帧图像与底层输入事件的严格因果对齐,而非依赖高层级应用接口。此外,跨操作系统环境(macOS、Windows、浏览器)的统一轨迹记录与视频帧抽取技术亦构成显著工程挑战,以确保数据的一致性与可复现性。
常用场景
经典使用场景
SynthUX Economy R5 W018 数据集的核心价值在于其为多应用计算机使用轨迹的深度研究提供了高保真的合成数据资源。该数据集通过模拟真实企业环境中的员工设备操作,记录下涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件、电子表格和演示文稿等多种桌面应用的连续操作流程。每个轨迹均包含从自然语言目标到具体鼠标键盘指令的完整映射,并辅以屏幕录像与逐帧截图。研究者可借助这些数据,探索多步骤、跨应用的任务执行模式,训练能够理解并复现复杂图形用户界面交互的智能代理,从而推动人机协作与自动化领域的前沿进展。
实际应用
从实际应用视角审视,该数据集为构建高度自主的桌面自动化系统提供了坚实的训练与测试基石。企业可利用此类数据训练智能助手,使其能够依据自然语言指令,如“整理本周跨部门会议纪要并发送邮件给相关同事”,自动完成跨应用的复杂操作流程,显著提升办公效率。在软件测试领域,开发者可基于这些轨迹模拟用户真实行为,实现端到端的回归测试与界面交互验证,突破传统单元测试的局限。此外,针对电话销售、客服支持等需要同时调用多个业务系统的岗位,基于此数据集训练的代理能够学习模仿专家操作路径,降低培训成本并减少人工错误,展现出在数字化劳动力管理、无障碍技术辅助等方面的广阔应用前景。
衍生相关工作
该数据集的面世催生了一系列富有成效的衍生研究。围绕其结构化轨迹数据,学术界和工业界已探索出多种经典工作:有研究者利用其对齐信息开发了基于视频帧序列的直接动作预测模型,绕开繁琐的中间表征学习;另有工作将其作为预训练数据源,结合大规模语言模型,构建出能够理解自然语言目标并生成对应低层级键盘鼠标指令序列的端到端系统。在评估框架方面,该数据集被用于设计更精细化的任务完成度衡量指标,例如通过比对节点树而非仅看最终状态来评判代理表现。此外,该数据蕴含的多员工、多角色企业模拟背景,也启发了一系列关于协作式多代理系统、组织层级中的任务分配与协调机制的研究工作,丰富了人机交互与多智能体系统的理论探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务