遇见数据集

jacob-valdez/synthux-economy-r5-w069

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5)是一个基于SynthUX生成的视觉计算机使用轨迹的合成数据集。每个记录代表一个模拟公司内一个工人的设备会话:目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频加上每节点帧。数据集支持应用原生多应用程序执行(无工作台覆盖)、每个参与者内容多样性、跨操作系统消息传递和大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。内容包含data.jsonl文件(每个渲染轨迹一个记录)、screenshots文件夹(每个终端节点一帧,在该节点的最后输入事件处拍摄)和videos文件夹(完整屏幕录制)。记录模式包括轨迹ID、参与者ID、公司、角色ID、标题、环境、自然语言目标、节点树、输入事件、观察结果、对齐和媒体文件。统计信息显示轨迹数为36,视频36个,帧987个,公司6个,环境分布为browser-os (9)、macos-web-next (9)、windows-web-next (18)。数据集由SynthUX生成,观察结果是因果的(突变通道为低级别输入),捕获过程中未使用高级别应用程序突变。

The SynthUX Computer-Use Dataset — economy sim r5 is a synthetic dataset of grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo. Contents include data.jsonl (one record per rendered trajectory), screenshots folder (a frame per terminal node, taken at that nodes last input event), and videos folder (the full screen recording). Record schema includes trajectory_id, actor_id, company, role_id, title, env, goal, tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, media.video, and media.frames. Stats show trajectories: 36, videos: 36, frames: 987, companies: 6, by env: browser-os (9), macos-web-next (9), windows-web-next (18). Provenance: generated with SynthUX, observations are causal (mutation channel = low_level_input); no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w069 数据集图片
构建方式
SynthUX-Economy-R5-W069 数据集源自 SynthUX 框架,旨在生成基于真实桌面环境的计算机使用轨迹。其构建方式以模拟企业经济运行为核心:每个记录对应一名员工在虚拟公司内的设备会话,一条自然语言目标被展开为节点树,终端节点通过低层级鼠标与键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、电子表格、幻灯片等)。完整的屏幕操作过程被录制为视频,并为每个终端节点捕获一帧图像。该过程采用应用原生多应用执行模式,无需工作台叠加层,并确保每名演员的内容多样性、跨操作系统消息传递及多公司经济体系的仿真。
特点
该数据集具有鲜明的多应用、多公司经济模拟特点,涵盖36条轨迹、987帧图像及6家仿真公司,支持macOS、Windows及浏览器三种操作系统环境。每条轨迹包含丰富的字段信息:演员身份、公司归属、角色、目标自然语言、终端节点详情(界面、动作、目标、参数)、密集的低层级输入事件序列(含时间戳)、因果模拟器状态记录以及节点与事件的对齐关系。数据集强调因果性,仅通过低层级输入引发状态变化,避免高层应用突变干扰,呈现原生环境下的真实人机交互行为。
使用方法
本数据集适用于训练与评估具备图形用户界面操控能力的智能体。用户可通过加载data.jsonl文件获取结构化的轨迹记录,利用screenshots目录下的逐帧图像进行视觉特征提取,或使用videos目录中的完整屏幕录制视频进行序列建模。每条轨迹的输入事件与观测状态构成因果时间序列,支持构建模仿学习或强化学习算法。数据集的多公司多角色设计使其具备丰富的任务多样性,是开发与测试跨应用、跨平台GUI自动化模型的理想基准资源。
背景与挑战
背景概述
随着图形用户界面(GUI)智能体的快速发展,如何在海量多应用协同场景下构建高质量、高保真的计算机使用轨迹数据成为关键瓶颈。SynthUX Computer-Use数据集(economy sim r5)由SynthUX团队于2025年发布,旨在通过合成模拟方式生成多公司经济体中的GUI智能体操作轨迹。该数据集的核心研究问题是:在缺乏真实用户数据的前提下,如何生成包含跨操作系统消息、多应用协作以及角色多样性的视觉化计算机使用行为记录。每个记录完整涵盖了从自然语言目标到终端节点操作的完整链路,包括低层级鼠标键盘事件、屏幕视频与逐帧截图,为GUI智能体的训练与评估提供了可靠、可复现的基准。其创新的多公司模拟范式与原生多应用执行机制,显著提升了数据在复杂企业环境中的适用范围,有望推动计算机使用智能体从单一任务向大规模协同场景的跨越。
当前挑战
该数据集所解决的领域问题之一是GUI智能体在复杂多应用环境中的行为建模挑战:传统数据集往往聚焦单一应用或简单任务,难以覆盖跨应用的信息传递与多角色协作,而SynthUX通过构建完整的经济模拟体系,迫使智能体在多个应用程序(如终端、笔记、VS Code、浏览器、邮件等)间执行连贯操作,模拟真实办公场景中的复杂决策链。在构建过程中,最大挑战在于生成真实感强且逻辑自洽的合成轨迹,避免过早显式使用高级API而破坏数据的因果一致性——SynthUX通过仅依赖低层输入事件(如鼠标与键盘操作)作为变异通道,确保观测结果完全由底层行为驱动,此外还需协调不同操作系统模拟器(macOS、Windows、浏览器OS)间的行为差异,并保证每段轨迹的多样性(包括6家公司、36条轨迹、987帧图像),以平衡数据规模与生成成本之间的约束。
常用场景
经典使用场景
在计算机智能体与图形用户界面交互的前沿领域,SynthUX经济模拟数据集为多应用协同操作研究提供了独特的实验平台。该数据集记录了模拟公司中不同角色员工在完整桌面环境下的操作轨迹,涵盖终端、编辑器、浏览器、邮件及即时通讯等多种应用程序的跨应用协作。经典使用场景聚焦于构建和理解能够执行复杂、多步骤工作流程的GUI智能体,例如让智能体同时处理Slack消息、更新Sheet表格并发送邮件通知,从而评估其在真实多应用环境中的任务规划与执行能力。
解决学术问题
该数据集旨在解决当前GUI智能体研究中缺乏真实多应用、多账户交互场景的痛点。传统数据集多局限于单应用或简化界面,难以反映现实工作中的跨应用协作与信息流转。SynthUX通过模拟包含6家公司的经济生态,提供了36条带有低层输入事件与屏幕录像的高保真轨迹,为研究跨环境(macOS、Windows、浏览器)下智能体的泛化能力、多任务调度策略以及长时序行为理解提供了关键数据支撑。其意义在于弥合了简化实验与现实部署之间的鸿沟,推动智能体研究从单一工具调用迈向复杂工作流自动化的新阶段。
衍生相关工作
该数据集的发布催生了一系列衍生研究工作,主要集中在三个方面:首先,基于低层输入事件与对齐信息的细粒度动作检测模型,用于从屏幕录像中自动提取和标注原子操作序列;其次,利用轨迹数据训练视觉语言模型以理解GUI状态变化与用户意图之间的因果联系;最后,借鉴多公司经济模拟框架,研究者进一步构建了包含数千个代理的大规模虚拟组织数据集,用于探索层级化任务分解与多智能体系统中的通信协议学习。这些工作共同推动了计算机交互智能体从孤立命令执行到上下文感知协同的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务