遇见数据集

synthux-economy-r5-w045

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX Computer-Use数据集(economy sim r5版本)是一个由SynthUX生成的、基于视觉的计算机使用轨迹合成数据集,模拟公司经济环境中的工作会话。每个记录代表一名员工在模拟公司设备上的会话过程,其中自然语言目标扩展为节点树,并通过低级别的鼠标/键盘输入驱动真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。观察到的轨迹被记录为屏幕视频以及每个节点的帧。数据集支持应用程序原生多应用执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递以及大型多公司经济模拟。数据集包含data.jsonl文件(每条记录对应一个渲染的轨迹)、screenshots目录(存储每个终端节点在其最后输入事件时刻捕获的帧)和videos目录(存储完整的屏幕录制视频)。数据记录模式包括轨迹ID、参与者ID、公司、角色ID、职位、模拟器环境、自然语言会话目标、参与者的终端节点树(包含表面、动作、目标、参数)、密集的低级别鼠标/键盘/脚本输入事件序列、每个节点后的因果模拟器状态观察结果、观察结果与输入事件范围到节点ID的对齐链接,以及媒体引用(视频和每节点PNG帧)。本版本的统计数据显示:共有36条轨迹、36个视频、904帧、涉及6家公司,按环境分布为:browser-os(4条)、macos-web-next(19条)、windows-web-next(13条)。数据由SynthUX生成,观察结果是因果性的(突变通道为低级别输入),在捕获过程中未使用高级别的应用程序突变。

The SynthUX Computer-Use Dataset (economy sim r5 version) is a vision-based synthetic dataset of computer interaction trajectories generated by SynthUX, which simulates work sessions within a corporate economic environment. Each record represents a work session of an employee operating simulated corporate devices, where natural language goals are expanded into node trees, and real desktop simulator applications (including terminals, Notes, VS Code, browsers, Slack/Teams, email clients, spreadsheets, presentation software, etc.) are driven by low-level mouse, keyboard, and script inputs. Recorded trajectories are saved as screen videos and frames for each individual node. This dataset supports native multi-application execution (without workspace overlay), content diversity for individual participants, cross-operating system messaging, and large-scale multi-company economic simulations. The dataset package includes the data.jsonl file (each line corresponds to one rendered trajectory), the screenshots directory (storing frames captured at the moment of the last input event for each terminal node), and the videos directory (storing full screen recording videos). The data record schema encompasses trajectory ID, participant ID, company, role ID, job title, simulator environment, natural language session goal, the participant's terminal node tree (containing surface, action, target, and parameters), dense sequences of low-level mouse, keyboard, and script input events, causal simulator state observations made after each node, alignment links mapping observation and input event scopes to node IDs, and media references (including full videos and per-node PNG frames). Statistics for this version indicate that there are 36 total trajectories, 36 corresponding videos, 904 frames in total, involving 6 companies. The distribution across simulator environments is as follows: browser-os (4 trajectories), macos-web-next (19 trajectories), windows-web-next (13 trajectories). The dataset is generated by SynthUX, with observations being causal (the mutation channel is low-level inputs), and no high-level application mutations were used during the data capture process.

创建时间:
2026-05-30
原始信息汇总

数据集概览

SynthUX Computer-Use Dataset — economy sim r5 是一个用于计算机使用场景的合成轨迹数据集,专注于模拟企业环境中的多应用交互行为。

核心内容

  • 数据文件data.jsonl,每行记录一条渲染后的轨迹数据。
  • 截图文件screenshots/<trajectory>/<node_id>.png,每个终端节点对应一张帧图像,取自该节点最后一次输入事件时。
  • 视频文件videos/<trajectory>.webm,完整的屏幕录制。

记录字段说明

字段 含义
trajectory_id 唯一标识(格式:<actor>__<env>
actor_id, company, role_id, title 执行者身份及所属组织信息
env 模拟器类型:macos-web-next / windows-web-next / browser-os
goal 本次会话的自然语言目标
tree.nodes 执行者的终端节点(包含surface, action, target, args
trajectory.input_events 密集的低级鼠标/键盘/脚本事件,含时间戳t_ms
trajectory.observations 每个节点后的因果模拟器状态
trajectory.alignment 将观测和输入事件范围链接到节点ID
media.video 屏幕录制(webm格式)
media.frames 每个节点的PNG帧(节点ID、时间戳、二进制引用)

数据统计(本构建版本)

  • 轨迹数量:36条
  • 视频数量:36个;帧数量:904张
  • 公司数量:6家
  • 按模拟器环境分布browser-os(4条)、macos-web-next(19条)、windows-web-next(13条)

生成来源

数据集由 SynthUX 生成(版本:synthux.multicompany.day.v1)。观测数据是因果的(突变通道为低级输入),采集过程中未使用高层应用突变。

许可协议

Apache-2.0

搜集汇总
数据集介绍
synthux-economy-r5-w045 数据集图片
构建方式
本数据集基于SynthUX框架生成,专注于模拟公司环境中的多应用桌面操作轨迹。构建过程中,每个工作者的设备会话被设定为一个自然语言目标,该目标被扩展为一棵节点树,终端节点通过低层次的鼠标与键盘输入驱动真实桌面模拟器应用程序,包括终端、笔记、编辑器、浏览器、即时通讯、邮件、电子表格及演示文稿等。整个操作轨迹被记录为屏幕视频及每个节点的独立帧图像,确保对操作过程的完整捕获。数据从模拟多层公司经济体系的多代理交互中生成,无工作台覆盖层干扰,保证了应用原生执行环境的真实性。
特点
该数据集的核心特点在于其多应用原生执行与跨平台兼容性,支持macOS、Windows及浏览器操作系统模拟。每个轨迹记录了代理身份、所属公司、角色及自然语言目标,并通过节点树结构呈现终端动作与输入事件。数据包含了低层次鼠标键盘事件的时间戳序列、因果模拟器状态、以及节点与观察结果的对齐信息。特别地,轨迹均遵循因果记录原则,仅使用低级输入变异通道,避免了高层应用突变的干扰,确保了操作序列的真实性与可追溯性。当前版本包含36条轨迹、904帧图像及6家模拟公司,展示了丰富的多公司经济交互场景。
使用方法
用户可通过HuggingFace数据集加载工具直接使用,数据以JSON Line格式存储于data.jsonl文件中,每条记录对应一个完整渲染轨迹。媒体文件分别存放于screenshots与videos子目录,其中视频为WebM格式,帧为PNG格式。研究人员可依据trajectory_id字段访问特定会话,借助input_events与observations字段复现操作序列,或利用alignment字段建立节点与事件的精确映射。该数据集特别适用于训练GUI代理的视觉定位与多步推理能力,以及评估跨应用操作规划的泛化性能。
背景与挑战
背景概述
SynthUX Computer-Use(economy sim r5)数据集由SynthUX团队于近期创建,旨在模拟企业环境中多应用协同操作的视觉计算机使用轨迹。该数据集聚焦于GUI代理(graphical user interface agents)这一前沿研究领域,核心研究问题是如何通过低层级鼠标键盘输入,在真实桌面模拟器(如终端、VS Code、浏览器、邮件等)中生成端到端的、可观测的视觉轨迹。通过构建包含6家公司、36条轨迹、904帧图像的仿真经济体系,该数据集为多应用、跨操作系统(macOS, Windows, Browser)的计算机使用行为提供了标准化基准。其独特之处在于采用原生多应用执行模式,而非工作台覆盖层,从而更真实地反映人类操作者的协作与任务切换流程,对推动仿生智能代理的泛化能力具有重要价值。
当前挑战
该数据集旨在应对两大核心挑战。一是领域问题层面的挑战:现有GUI代理数据集多局限于单一应用或有限任务,缺乏多应用、多角色、多公司经济系统中的复杂协作场景。SynthUX通过模拟真实企业环境中的跨应用、跨设备交互,解决了代理在动态上下文、目标分解和长尾操作中的泛化难题。二是构建过程中的挑战:生成高质量因果轨迹需确保低层级输入事件与观察状态严格对齐,且避免高层应用突变干扰。数据集通过强制使用低层级输入作为变异通道,并记录每节点帧序列,但36条轨迹的规模仍显不足,且浏览器端场景占比低,可能限制模型在网页交互任务中的迁移性。此外,跨OS消息传递的一致性维护与大规模多公司经济的扩展性也是数据生成的重要技术瓶颈。
常用场景
经典使用场景
SynthUX Economy R5 W045数据集为多应用计算机使用场景下的GUI代理研究提供了高质量的训练与评估资源。该数据集的核心价值在于其模拟了真实企业环境中员工完成复杂、多步骤任务的完整轨迹,涵盖了终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格和演示文稿等多种桌面应用的协同操作。其经典的使用方式是将每个轨迹中的低层级鼠标键盘事件序列和对应的屏幕视频帧作为多模态输入,用于训练能够理解图形界面并执行跨应用操作的人工智能代理。研究人员可将目标文本与轨迹数据进行对齐,构建从自然语言指令到具体GUI操作的端到端生成模型,从而推动计算机使用领域中自主代理能力的边界。
衍生相关工作
围绕SynthUX Economy R5 W045数据集已衍生出若干具有影响力的研究脉络。其一是在多应用GUI代理的架构设计方面,该数据集促进了混合模型的发展,这类模型结合视觉语言大模型进行界面理解与基于结构化规划的强化学习进行动作决策。其二是数据增强与仿真策略的改进,研究者利用其多公司设定的特征,探索不同组织架构与通信模式对代理行为泛化能力的影响。此外,该数据集催生了关于GUI代理可解释性与安全性的研究工作,通过分析其因果对齐的观测链条,学界能够更精准地评估代理在未知界面变体上的鲁棒性,推动了计算机使用领域从单应用任务向规模化、多角色协作场景的演进。
数据集最近研究
最新研究方向
在当前图形用户界面(GUI)智能体研究的前沿,SynthUX Economy R5 W045数据集以其创新的多应用、多公司经济模拟框架,为计算机使用智能体的训练与评估注入了新动力。该数据集通过模拟真实企业环境中的工人设备会话,记录了从自然语言目标到低级鼠标键盘输入的完整轨迹,涵盖终端、代码编辑器、浏览器、通讯软件及办公套件等多应用协同场景。其核心价值在于摆脱了单一应用或叠加工作台的限制,实现了原生跨应用执行与跨操作系统消息传递,有力推动了GUI智能体在复杂、动态、多任务环境下的泛化能力研究。这一成果与当前业界对“计算机使用智能体”解决真实业务流程自动化难题的热切关注高度契合,为构建能够理解并操作完整数字工作流的自主系统提供了关键数据基石,预示着人机交互范式向更深层次生态模拟与智能协作的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务