遇见数据集

synthux-economy-r5-w061

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(economy sim r5)是一个由SynthUX生成的、基于视觉的计算机使用轨迹数据集,模拟公司环境下的员工设备会话。它通过将高层目标展开为节点树,终端节点利用底层鼠标和键盘输入驱动真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、Sheets、Slides等),并记录轨迹为屏幕视频和每个节点的帧图像。数据集支持应用原生的多应用程序执行(无工作台覆盖),具有参与者内容多样性、跨操作系统消息传递以及大规模多公司经济模拟等特点,每个经济模拟作为独立的数据集仓库发布。内容包括:data.jsonl文件(每个渲染轨迹的记录)、screenshots目录(节点在最后一个输入事件时捕获的PNG帧截图)、videos目录(完整屏幕录制视频,WebM格式)。每条记录包含唯一轨迹ID、参与者ID、所属公司、角色ID、职位、模拟环境(macos-web-next / windows-web-next / browser-os)、会话的自然语言目标、参与者的终端节点树(含表面、操作、目标、参数)、密集的底层鼠标/键盘/脚本输入事件序列(带时间戳)、每个节点后的因果模拟器状态观察、观察与输入事件范围到节点ID的对齐链接,以及媒体文件引用(视频和节点帧)。数据统计:共36条轨迹,1051帧图像,涉及6家不同公司;模拟环境分布为browser-os(11条)、macos-web-next(10条)、windows-web-next(15条)。数据集使用SynthUX(synthux.multicompany.day.v1)生成,观察过程是因果性的(突变通道为底层输入),在捕获过程中未使用高级应用程序突变,适用于GUI智能体、计算机使用、多应用程序交互等研究任务。

The SynthUX Computer Usage Dataset (economy sim r5) is a vision-based computer usage trajectory dataset generated by SynthUX, simulating employee device sessions in a corporate environment. It unfolds high-level goals into node trees, where terminal nodes drive real desktop simulator applications (e.g., terminal, notes, VS Code, browser, Slack/Teams, email, Sheets, Slides, etc.) via low-level mouse and keyboard inputs, recording observed trajectories as screen videos and frame images per node. The dataset enables application-native multi-application execution (no workbench overlay), featuring participant content diversity, cross-OS messaging, and large-scale multi-company economic simulations, with each simulation released as an independent dataset repository. Contents include: a `data.jsonl` file (one record per rendered trajectory), a `screenshots` directory (PNG frame captures per node taken at the last input event), and a `videos` directory (full screen recording videos in WebM format). Each record follows a detailed schema, including: unique trajectory ID, participant ID, company, role ID, position, simulation environment (macos-web-next / windows-web-next / browser-os), natural language goal of the session, participants terminal node tree (with surface, action, goal, parameters), dense sequences of low-level mouse/keyboard/script input events (with timestamps), causal simulator state observations after each node, alignment links from observation and input event ranges to node IDs, and media file references (videos and node frames). Statistics for this version: 36 trajectories, 1051 frame images, involving 6 different companies; distribution by simulation environment: browser-os (11), macos-web-next (10), windows-web-next (15). The dataset is generated using SynthUX (synthux.multicompany.day.v1), with a causal observation process (mutation channel as low-level inputs) and no high-level application mutations used during capture, suitable for research tasks such as GUI agents, computer usage, and multi-application interaction.

创建时间:
2026-05-30
原始信息汇总

数据集概览

SynthUX Computer-Use 数据集 — economy sim r5 是一个用于计算机视觉和 GUI 代理研究的合成数据集,记录了模拟公司中工作人员的桌面操作轨迹。

核心内容

  • 数据格式:包含 data.jsonl(每条轨迹记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点的帧截图)和 videos/<trajectory>.webm(完整屏幕录制视频)。
  • 记录结构:每条轨迹包含轨迹 ID、参与者信息(公司、角色、职位)、模拟环境(macos-web-next / windows-web-next / browser-os)、自然语言目标、节点树、输入事件(鼠标/键盘/脚本,带时间戳)、观测状态、对齐信息、视频和帧媒体。

统计信息(本版本)

  • 轨迹数量:36
  • 视频数量:36 · 帧数量:1051
  • 公司数量:6
  • 按环境分布:browser-os (11)、macos-web-next (10)、windows-web-next (15)

生成与许可

  • 许可证:Apache-2.0
  • 生成方式:使用 SynthUX(multicompany.day.v1)生成,观测为因果模式,仅基于低层输入产生突变,无高层应用操作介入。
搜集汇总
数据集介绍
synthux-economy-r5-w061 数据集图片
构建方式
本数据集基于SynthUX框架生成,专注于模拟多应用桌面环境中的计算机使用轨迹。其构建方式别具匠心:每个数据记录对应一名虚拟员工在模拟公司内的设备会话。具体而言,一个高层目标被逐步拆解为一棵节点树,终端节点通过底层鼠标与键盘输入,直接驱动真实的桌面模拟器应用——涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等。整个观测轨迹以屏幕视频与逐节点帧的形式被忠实记录,确保了轨迹的因果性与完整性。
特点
该数据集的核心特点在于其高度真实与多样化的模拟生态。它实现了应用原生的多应用并行执行,摒弃了工作台覆盖层,因而更贴近真实用户的操作场景。同时,数据集引入了角色间的内容多样性、跨操作系统的消息通信,并构建了包含多家公司的大型经济模拟体系。每条轨迹都附带了从底层输入事件到顶层节点对齐的丰富元数据,包括密集的鼠标键盘事件流、因果模拟状态快照以及全屏视频,为研究GUI智能体的行为模式提供了详实素材。
使用方法
使用本数据集时,研究者可直接加载根目录下的`data.jsonl`文件,每行对应一条渲染完成的轨迹记录,包含轨迹ID、行为者信息、模拟环境、自然语言目标及节点树等关键字段。配套的`videos`文件夹提供完整的屏幕操作录像(.webm格式),而`screenshots`文件夹则按轨迹与节点ID组织,存放每终端节点最后一次输入事件时的截图帧(.png)。这种结构化存储使得研究者能够轻松结合文本元数据与视觉证据,用于训练或评估GUI智能体的理解与规划能力。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集诞生于智能体与图形用户界面交互研究的前沿领域,由研究团队于近期创建,旨在模拟真实企业环境中多应用协同操作的计算机使用行为。该数据集通过合成生成的方式,记录了模拟公司内员工在桌面操作系统(macOS、Windows、浏览器)上完成自然语言目标时的完整视觉轨迹,涵盖了终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格和幻灯片等多款应用的底层鼠标与键盘操作。其核心研究问题在于如何构建可扩展、多实体、跨应用的经济模拟环境,以推动GUI智能体从单一任务执行向复杂组织协作场景的演进。该数据集以每36条轨迹、6家模拟公司、1051帧图像的规模,为计算机使用行为研究提供了首个基于多公司经济仿真的标准化基准,对智能体在真实桌面环境中的泛化能力评估具有重要推动作用。
当前挑战
该数据集所面对的领域挑战主要源于GUI智能体在真实企业环境中的部署困难:现有系统通常局限于单一应用或预定义工作流,难以应对跨应用、多步骤且包含组织层级的复杂任务,例如员工在聊天工具中接收指令后,需依次操作代码编辑器、终端和协作平台完成工作。构建过程中,团队需解决合成数据与真实用户行为偏差的鸿沟,确保模拟的经济活动、角色层级和消息传递逻辑具备足够的内容多样性;同时,低层次输入事件(鼠标点击、按键序列)与高层语义目标之间的一致对齐是关键难点,需在不依赖应用程序高级接口的前提下,通过因果关系监控来保证观测数据的因果真实性。此外,跨操作系统(macOS、Windows、浏览器)的视觉环境差异、多公司并行模拟的计算开销,以及视频帧与节点级帧的时空同步,均为数据集建设中的技术挑战。
常用场景
经典使用场景
SynthUX-Economy-R5-W061数据集专为多应用计算机使用(computer-use)场景下的图形用户界面(GUI)智能体研究而设计。它记录了一名模拟公司员工在真实桌面模拟器(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等应用程序)中,通过底层鼠标和键盘输入完成自然语言目标的全过程。每个轨迹包含完整的屏幕视频、每个终端节点的帧截图,以及密集的低级输入事件和因果状态观察。该数据集最经典的使用场景是训练和评估能够理解并操作复杂多窗口、跨应用程序工作流的GUI智能体,特别是在企业级经济模拟环境中,智能体需同时处理消息、文档编辑、代码编写和数据分析等多种任务。
实际应用
在实际应用中,SynthUX-Economy-R5-W061数据集可支撑企业级RPA(机器人流程自动化)系统的智能化升级。例如,训练出的GUI智能体能够自主完成客户订单处理流程,包括从邮件中提取需求、在表格中更新数据、通过Slack通知相关同事,并最终在浏览器中生成报价单,从而替代人工的重复性跨应用操作。此外,该数据集也适用于软件开发中的自动化测试场景,智能体可按照自然语言描述的测试用例,在集成开发环境、版本控制平台和项目管理系统之间执行验证操作。在数字办公领域,基于此数据集训练的智能助手能够辅助员工管理日程、整理笔记、编写代码草稿并同步至协作工具,显著提升工作效率。
衍生相关工作
该数据集的发布催生了一系列相关研究工作的开展。在数据层面,研究者开始探索基于该数据集的经济模拟模式,生成更大规模、包含更多公司和角色的多轨迹数据集,如SynthUX-MultiCompany系列,以支持复杂场景下的智能体预训练。在模型架构方面,衍生工作提出了分层视觉-语言模型,利用数据集中的视频帧和低级事件序列来学习GUI操作的原语表示,并进一步结合因果状态观测进行端到端的模仿学习。此外,部分工作将该数据集作为基准,评估不同智能体在跨应用任务上的泛化能力,并针对数据集中的错误路径和低效操作,提出了基于奖励模型的优化方法,推动了GUI智能体在探索与利用、安全性和可解释性等方面的研究进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务