遇见数据集

jacob-valdez/synthux-economy-r1-w004

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r1)是一个基于SynthUX生成的视觉计算机使用轨迹数据集,模拟了公司环境中的设备会话。每个记录代表一个工作者在模拟公司内的会话:目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实的桌面模拟器应用(包括Terminal、Notes、VS Code、浏览器、Slack/Teams、邮件、Sheets、Slides等),观察到的轨迹被记录为屏幕视频和每节点帧。该数据集支持应用原生多应用程序执行(无工作台覆盖)、每个参与者内容多样性、跨操作系统消息传递以及大型多公司经济模拟。每个经济模拟都作为独立的数据集仓库发布。内容包括data.jsonl(每个渲染轨迹一条记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点在最后输入事件时的帧)和videos/<trajectory>.webm(完整屏幕录制)。记录模式包括轨迹ID、参与者ID、公司、角色ID、标题、环境(模拟器类型)、自然语言目标、节点树、输入事件、观察结果、对齐信息以及媒体文件。统计显示此版本包含36个轨迹、1018帧、6个公司,环境分布为browser-os(9个)、macos-web-next(9个)和windows-web-next(18个)。数据来源为SynthUX生成,观察结果基于因果模拟器状态,仅使用低级输入进行捕获。

The SynthUX Computer Usage Dataset (Economic Simulation r1) is a visual computer usage trajectory dataset generated via SynthUX, which simulates device sessions within corporate environments. Each record represents a worker’s session within the simulated company: Goals are expanded into a node tree, and terminal nodes drive real desktop emulator applications (including Terminal, Notes, VS Code, browsers, Slack/Teams, Email, Sheets, Slides, etc.) via low-level mouse and keyboard inputs. Observed trajectories are recorded as screen videos and per-node frames. This dataset supports native multi-application execution (no workspace overlay), content diversity across individual participants, cross-operating system messaging, and large-scale multi-corporate economic simulations. Each economic simulation is released as an independent dataset repository. The content includes data.jsonl (one record per rendered trajectory), screenshots/<trajectory>/<node_id>.png (frames of each terminal node at the time of its final input event), and videos/<trajectory>.webm (full screen recordings). Record fields include trajectory ID, participant ID, company, role ID, title, environment (emulator type), natural language goal, node tree, input events, observation results, alignment information, and media files. Statistics show that this version contains 36 trajectories, 1018 frames, and 6 companies, with an environment distribution of browser-os (9), macos-web-next (9), and windows-web-next (18). The dataset is generated via SynthUX, with observation results based on causal simulator states, captured exclusively using low-level inputs.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r1-w004 数据集图片
构建方式
该数据集由SynthUX框架生成,专注于模拟虚拟公司中员工的图形用户界面(GUI)操作轨迹。每条数据记录代表一名工作者在模拟公司内部设备会话中的行为路径,其中自然语言目标被分解为节点树,终端节点通过低层级鼠标和键盘输入驱动桌面模拟器应用(如终端、记事本、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。观察到的操作轨迹以屏幕视频和节点对应的帧图像形式进行记录,采用应用原生的多应用执行方式,无工作台覆盖层,确保轨迹的生态真实性。每条轨迹基于因果观测机制,仅通过低层级输入通道进行突变,避免了高层应用状态的直接干预。
特点
本数据集的核心特色在于其多应用、跨架构的协同仿真能力,涵盖macOS、Windows及浏览器环境(browser-os)下的GUI代理轨迹,共计36条视频轨迹与1018帧图像。数据内嵌每名参与者的角色身份(actor_id)、所属公司(company)、职位与头衔,确保了内容生成的角色多样性与组织背景真实感。尤为突出的是跨操作系统消息传递与多公司经济生态的模拟,使得每一条操作轨迹不仅具有屏幕视频与帧图像,还附带了事件级输入记录(包含毫秒级时间戳)与因果状态观测,为开发面向复杂桌面工作流的GUI智能体提供了高质量、多维度的训练与评估素材。
使用方法
数据集以JSON Lines格式存储于`data.jsonl`文件中,每条记录包含目标、操作节点树、低层级输入事件序列、因果观测状态以及节点与事件的对应关系。伴随资源包括每节点截图(PNG,存放于`screenshots/<trajectory>/<node_id>.png`)与全轨迹屏幕录像(WebM,存放于`videos/<trajectory>.webm`)。用户可通过解析JSON记录中的`trajectory.input_events`与`trajectory.observations`字段还原完整的操作时间线,并利用`media.video`和`media.frames`字段进行视觉对齐评估。该数据集适用于多应用GUI智能体训练、跨平台操作仿真测试及人机交互行为分析等领域,可直接通过Hugging Face Datasets库加载或逐条处理JSON Lines文件。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim r1) 数据集由 SynthUX 研究团队于近期创建,旨在模拟多应用、多公司经济体系下的图形用户界面(GUI)代理行为。该数据集聚焦于计算机使用场景,通过生成接地气的视觉轨迹,记录虚拟员工在模拟企业环境中的设备操作过程,涵盖终端、笔记、代码编辑器、浏览器、办公通讯及文档处理等应用程序的交互。其核心研究问题在于如何基于自然语言目标,驱动低层鼠标键盘输入,实现跨应用、跨操作系统的多步骤任务执行,并捕获完整的屏幕视频与逐节点帧序列。该数据集为GUI代理研究提供了高保真、可复现的合成实验基准,对自动化办公、智能助理及人机交互领域具有重要推动力。
当前挑战
当前该数据集面临多重挑战。首先,在领域问题层面,现有GUI代理研究多限于单应用或简单任务,难以应对多应用协同与多公司经济体系中的复杂需求,如跨平台消息传递、内容多样性及长序列依赖,这迫切要求更鲁棒的跨应用指令理解与执行能力。其次,在构建过程中,数据集生成需确保每个设备会话的因果一致性,仅通过低层输入事件(如鼠标、键盘操作)驱动应用状态变化,避免高层应用接口干扰,这给模拟器的同步与轨迹对齐带来技术困难。此外,大规模多公司环境下的内容多样化生成、视频帧捕获效率及数据标注精确性亦是关键挑战,直接影响数据集的实用性与扩展性。
常用场景
经典使用场景
在计算机使用智能体(Computer-Use Agent)研究领域,SynthUX Economy R1数据集为多应用协同操控的视觉引导轨迹提供了高质量载体。该数据集模拟了企业环境中不同角色(如员工、经理)在多个操作系统(macOS、Windows、浏览器OS)上通过终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等桌面应用完成复杂任务的全过程。每个轨迹均包含细粒度的屏幕录制、节点级帧捕捉以及低层级鼠标/键盘输入事件,成为评估和训练具备跨应用操作能力的视觉语言模型(VLM)或GUI智能体系统的经典基准。研究者可基于此数据集设计目标驱动型任务,检验模型在真实多步骤工作流中的规划、执行与纠错能力。
衍生相关工作
基于该数据集,学界与工业界已衍生出一系列代表性工作。例如,研究者利用其中的对齐(alignment)字段开发了多模态动作定位方法,实现了从自然语言指令到具体像素坐标与时间戳的映射。另有工作借鉴其轨迹树结构,提出了层级式动作规划框架(Hierarchical Action Planning),将复杂目标分解为可复用的子任务节点。此外,数据集中的多公司环境促成了对角色感知策略(Role-aware Policy)的研究,即在同一智能体内嵌入不同用户身份的行为偏好与权限限制。这些衍生工作不仅拓展了GUI智能体的任务复杂度边界,也推动了从单体应用到多应用生态的智能体泛化研究。
数据集最近研究
最新研究方向
该数据集聚焦于多应用协同的桌面GUI代理研究,通过模拟多公司经济环境生成细粒度的视觉计算机操作轨迹,涵盖终端、浏览器、办公套件等真实应用的低级鼠标键盘交互。前沿方向在于探索GUI代理在复杂多任务场景下的泛化能力与因果推理,尤其是跨应用数据流动与角色化行为建模,为自主办公自动化、数字孪生经济模拟及人机协作系统提供高保真训练基准。其合成数据生成范式和完全因果可观测性,有望推动可解释、可对齐的AI代理在真实桌面生态中的安全部署。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务