遇见数据集

synthux-economy-r5-w066

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX Computer-Use数据集(economy sim r5版本)是一个合成的、多应用程序的计算机使用轨迹数据集,专门设计用于图形用户界面(GUI)代理和计算机使用研究。该数据集模拟了公司环境中工作人员的设备会话,通过SynthUX系统生成基于视觉的交互轨迹。每个记录代表一个完整的用户会话,其中自然语言目标被扩展为节点树,终端节点通过低级鼠标和键盘输入驱动真实的桌面模拟器应用程序,包括终端、笔记软件、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等。数据集采用应用程序原生的多应用程序执行模式,无需工作台覆盖,确保交互的真实性。数据集包含36个轨迹,涉及6个不同的虚拟公司,覆盖三种模拟环境:browser-os(10个轨迹)、macos-web-next(12个轨迹)和windows-web-next(14个轨迹)。每个轨迹记录包括完整的屏幕录制视频(WebM格式)、每个终端节点在最后输入事件时刻捕获的PNG帧图像,以及结构化的JSONL元数据。元数据字段包括轨迹ID、参与者信息(演员ID、公司、角色ID、职位)、模拟环境、自然语言目标、节点树结构(包含表面、动作、目标、参数)、密集的低级输入事件序列(带时间戳)、因果模拟器状态观察结果,以及观察结果与节点ID的对应关系。数据集旨在支持跨操作系统消息传递、多公司经济模拟的研究,适用于GUI自动化、人机交互分析、任务导向对话系统训练等场景。数据生成过程中仅使用低级输入突变,确保观察结果的因果性,未采用高级应用程序突变,提高了数据的可靠性和可复现性。

SynthUX Computer-Use Dataset (economy sim r5 version) is a synthetic, multi-application computer interaction trajectory dataset specifically designed for graphical user interface (GUI) agents and computer use research. This dataset simulates device sessions of workers in corporate environments, generating vision-based interaction trajectories via the SynthUX system. Each record represents a complete user session, where natural language goals are expanded into node trees, and terminal nodes drive real desktop emulator applications via low-level mouse and keyboard inputs, including terminals, note-taking software, VS Code, browsers, Slack/Teams, email, spreadsheets, presentations, etc. The dataset adopts the native multi-application execution mode of applications without desktop overlay, ensuring the authenticity of interactions. The dataset contains 36 trajectories across 6 distinct virtual companies, covering three simulation environments: browser-os (10 trajectories), macos-web-next (12 trajectories), and windows-web-next (14 trajectories). Each trajectory record includes full screen recording videos (in WebM format), PNG frame images captured at the final input event moment for each terminal node, and structured JSONL metadata. The metadata fields include trajectory ID, participant information (actor ID, company, role ID, job title), simulation environment, natural language goals, node tree structure (including surface, action, target, parameters), dense low-level input event sequences with timestamps, causal simulator state observations, and the correspondence between observations and node IDs. This dataset is intended to support research on cross-operating system messaging and multi-company economic simulation, and is applicable to scenarios such as GUI automation, human-computer interaction analysis, and task-oriented dialogue system training. Only low-level input mutations are used during the data generation process to ensure the causality of observations, and high-level application mutations are not adopted, improving the reliability and reproducibility of the dataset.

创建时间:
2026-05-30
原始信息汇总

数据集概述

SynthUX Computer-Use Dataset — economy sim r5 是一个由 SynthUX 生成的、基于视觉的计算机操作轨迹数据集,模拟了经济模拟环境中的多应用桌面操作。

数据集内容

  • data.jsonl:每条记录对应一个渲染后的操作轨迹。
  • screenshots/<trajectory>/<node_id>.png:每个终端节点在其最后一次输入事件时的截图。
  • videos/<trajectory>.webm:完整的屏幕录制视频。

记录字段说明

字段 含义
trajectory_id 唯一标识(<actor>__<env>
actor_id, company, role_id, title 操作者身份及所属组织信息
env 模拟器类型:macos-web-next / windows-web-next / browser-os
goal 会话的自然语言目标
tree.nodes 操作者的终端节点(包含 surface, action, target, args
trajectory.input_events 密集的低级鼠标/键盘/脚本事件及时间戳 t_ms
trajectory.observations 每个节点后的因果模拟器状态
trajectory.alignment 将观测与输入事件范围关联到节点ID
media.video 屏幕录制视频(webm格式)
media.frames 每个节点的PNG截图(包含节点ID、时间戳、blob引用)

数据集规模(本次构建)

  • 轨迹数量:36
  • 视频数量:36,截图数量:1049
  • 模拟公司数量:6
  • 各模拟器轨迹分布browser-os 10条,macos-web-next 12条,windows-web-next 14条

数据来源与生成

  • 使用 SynthUX 生成(版本:synthux.multicompany.day.v1)。
  • 观测过程是因果性的(突变通道为低级输入 low_level_input),捕获期间未使用高级应用突变。
  • 数据集遵循 Apache-2.0 许可证。
搜集汇总
数据集介绍
synthux-economy-r5-w066 数据集图片
构建方式
本数据集基于SynthUX框架生成,模拟了虚拟公司中员工在桌面环境下的计算机操作轨迹。每个记录对应一个工作会话,其中自然语言目标被逐步分解为节点树,终端节点通过低层级鼠标与键盘输入驱动模拟器原生应用(如终端、代码编辑器、浏览器、邮件客户端、电子表格等)执行操作。观测轨迹以屏幕视频和每节点帧的形式被完整记录,所有交互均在无工作台覆盖的原生多应用环境中进行,确保了数据的真实性与可复现性。
特点
该数据集的一大特色在于其多公司经济模拟的规模与多样性,包含来自6家不同公司的36条轨迹、1049帧节点画面及对应视频。每条轨迹均携带丰富的元信息,包括参与者身份、所属组织、角色及设备环境(macOS、Windows或纯浏览器)。多应用跨平台通信与内容差异性设计,使得数据集能够支持对复杂图形用户界面代理在密集任务场景下的行为建模与评估。
使用方法
数据集以JSONL格式存储核心记录,可通过逐行读取data.jsonl文件加载每个轨迹的结构化字段。节点帧图像存放于screenshots目录下,按轨迹与节点ID组织,便于与对齐信息中的时间戳和输入事件序列联合使用。完整屏幕视频位于videos目录,提供全局视角的辅助分析。研究人员可利用这些数据训练或评估基于视觉的GUI代理,尤其适用于多任务、多应用协同场景下的行为理解与生成任务。
背景与挑战
背景概述
SynthUX Economy R5 W066数据集由SynthUX项目团队于近年创建,专注于生成基于计算机视觉的图形用户界面(GUI)操作轨迹,旨在模拟多用户、多应用协同的企业经济环境。该数据集通过模拟公司内部员工的设备会话,将自然语言目标分解为节点树,终端节点驱动低层级鼠标/键盘操作,在真实桌面模拟器(如终端、代码编辑器、浏览器、办公软件等)中执行,并记录屏幕视频和逐帧截图。其核心研究问题在于如何构建大规模、多应用、跨操作系统的合成GUI代理训练数据,以应对现实世界中隐私、成本和标注困难等挑战。该数据集对GUI智能体、鲁棒性训练及多任务协同等领域具有重要推动意义。
当前挑战
该数据集面临的挑战主要包括三个方面:第一,所解决的领域问题——GUI操作轨迹的自动生成与标注,传统依赖人工录制或合成数据的方法难以兼顾规模、多样性和真实性,且多应用协同场景下的跨应用状态耦合与意图对齐存在技术瓶颈。第二,构建过程中的挑战——如何确保低层级输入事件(鼠标/键盘)与高层级目标(如“发送邮件”)之间因果一致,避免模拟器状态漂移;同时,跨操作系统(macOS、Windows、浏览器)的兼容性和视觉差异增加了数据生成的复杂度。第三,多公司经济模拟中的角色多样性、私有内容和消息隔离要求数据生成框架具备高度可控性和可扩展性,而当前36条轨迹的规模仍显有限,需进一步解决长尾场景覆盖和计算成本问题。
常用场景
经典使用场景
在经济模拟与多应用交互的研究领域,SynthUX Economy仿真数据集为探索图形用户界面(GUI)智能体的行为轨迹提供了独到的实验平台。该数据集记录了模拟公司内员工在多应用程序环境(如终端、笔记、代码编辑器、浏览器、即时通讯、邮件及办公套件等)中的操作过程,涵盖从自然语言目标到低层级鼠标/键盘输入的完整轨迹。研究人员可借此训练和评估能够理解并执行复杂跨应用任务的GUI智能体,尤其是那些需要遵循多步骤流程、响应动态环境变化的智能体模型。其经典用途在于为计算机使用自动化研究提供高度结构化、多平台的标杆数据,推动从单一应用到多应用协同的智能体能力边界。
衍生相关工作
围绕该数据集,一系列富有启发性的研究工作已然或即将展开。在模型层面,研究者可能提出基于视觉变换器与行为克隆的跨应用策略网络,利用多层注意力机制解析屏幕帧序列中的界面状态跃迁。在理论层面,相关成果或会催生出针对低层级输入事件图与高层级意图树之间对齐关系的新型图神经网络架构。此外,该数据集为多智能体协同学习提供了温床,例如在企业模拟内衍生出协作型差分预测器,该预测器能够权衡不同角色(如会计与管理者)在共享场景中的任务优先级。这些衍生的经典工作,实质上将计算机使用智能体从单机脚本提升至具备组织生态理解力的认知系统。
数据集最近研究
最新研究方向
该数据集聚焦于多应用协同的图形用户界面代理研究,通过模拟多公司经济环境中的真实设备会话,生成带有底层鼠标与键盘操作记录的桌面操作轨迹。其前沿价值在于为计算机使用智能体提供涵盖跨平台操作系统、多角色协作及复杂工作流的规模化合成数据,助力探索无需人工标注的自主GUI代理训练范式。结合近期企业级自动化与数字员工热点,SynthUX数据集使得代理不仅能理解单一应用内的指令,更能应对跨应用消息传递、文档协同与任务编排的复杂场景,为构建可泛化的通用计算机操作智能体奠定可复现的评估基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务