遇见数据集

synthux-economy-r5-w047

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX Computer-Use Dataset — economy sim r5 是一个由 SynthUX 生成的合成数据集,专注于计算机使用轨迹的模拟。该数据集模拟了公司内部员工的设备会话:每个会话从一个自然语言目标开始,该目标扩展为节点树,终端节点通过低级鼠标和键盘输入驱动真实的桌面模拟器应用(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),并记录观察到的轨迹,包括屏幕视频和每个节点的帧图像。数据集支持应用原生的多应用执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递以及大规模多公司经济模拟。每个经济模拟都作为一个独立的数据集仓库发布。数据集包含以下内容:data.jsonl 文件(每个渲染轨迹对应一个记录)、screenshots/ 目录(每个终端节点在最后输入事件时捕获的 PNG 帧)和 videos/ 目录(完整的屏幕录制视频,格式为 WebM)。记录模式包括轨迹 ID、参与者 ID、公司、角色 ID、职位、模拟器环境(macos-web-next、windows-web-next 或 browser-os)、会话目标、节点树(包含表面、动作、目标和参数)、密集的低级输入事件(带时间戳)、因果模拟器状态观察结果、观察与输入事件范围到节点 ID 的对齐,以及媒体引用(视频和帧)。在本构建中,数据集包含 36 个轨迹、36 个视频、930 帧图像,涉及 6 个公司,按环境分布:browser-os(9 个)、macos-web-next(8 个)、windows-web-next(19 个)。数据集使用 SynthUX 生成,观察结果是因果的(突变通道为低级输入),捕获期间不使用高级应用突变。适用于计算机使用、GUI 代理、合成数据生成和多应用交互模拟等任务。

SynthUX Computer-Use Dataset — economy sim r5 is a synthetic dataset generated by SynthUX, focusing on the simulation of computer usage trajectories. This dataset simulates employee device sessions within companies: each session starts with a natural language goal, which is expanded into a node tree. Terminal nodes drive real desktop emulator applications (including terminals, Notes, VS Code, browsers, Slack/Teams, Mail, Sheets, Slides, etc.) via low-level mouse and keyboard inputs, while recording observed trajectories including screen videos and frame images for each node. The dataset supports natively multi-application execution (without workspace overlay), content diversity per participant, cross-OS messaging, and large-scale multi-company economic simulations. Each economic simulation is released as an independent dataset repository. The dataset includes the following components: the data.jsonl file (one record per rendered trajectory), the screenshots/ directory (PNG frames captured for each terminal node at the final input event), and the videos/ directory (full screen recording videos in WebM format). The record schema includes trajectory ID, participant ID, company, role ID, job title, emulator environment (macos-web-next, windows-web-next, or browser-os), session goal, node tree (containing surface, action, target, and parameters), dense low-level timestamped input events, causal emulator state observations, alignment between observation and input event ranges to node IDs, and media references (videos and frames). For this build, the dataset contains 36 trajectories, 36 videos, and 930 frame images, spanning 6 companies, with distribution by environment: browser-os (9), macos-web-next (8), windows-web-next (19). Generated using SynthUX, the dataset’s observations are causal (with mutation channels via low-level inputs), and no high-level application mutations are used during capture. It is applicable to tasks such as computer usage, GUI agent, synthetic data generation, and multi-application interaction simulation.

创建时间:
2026-05-30
原始信息汇总

数据集概述

SynthUX Computer-Use Dataset — economy sim r5 是一个用于计算机使用场景的合成轨迹数据集,专注于模拟公司内部员工在真实桌面环境中的操作行为。

数据集来源与性质

  • 生成工具:SynthUX(版本:synthux.multicompany.day.v1)
  • 许可协议:Apache-2.0
  • 任务类型:其他(other),涉及计算机使用、GUI智能体、合成数据、多应用交互
  • 数据特点:基于原生应用的跨应用执行(无工作台覆盖),支持跨操作系统消息传递,且在大型多公司经济模拟中生成

数据内容

  • 文件构成
    • data.jsonl:每条记录对应一个渲染完成的轨迹
    • screenshots/<trajectory>/<node_id>.png:每个终端节点的一张帧图像,捕捉该节点最后一次输入事件时的画面
    • videos/<trajectory>.webm:完整的屏幕录制视频

记录结构(Schema)

每条轨迹记录包含以下字段:

字段 说明
trajectory_id 唯一标识符,格式为 <actor>__<env>
actor_id, company, role_id, title 员工身份、所属公司、角色ID、职位名称
env 模拟器类型:macos-web-next / windows-web-next / browser-os
goal 该次会话的自然语言目标
tree.nodes 该操作者的终端节点(包含surface, action, target, args
trajectory.input_events 密集的低级鼠标/键盘/脚本事件,附带时间戳 t_ms
trajectory.observations 每个节点后的因果关系模拟状态
trajectory.alignment 将观测结果和输入事件范围与节点ID进行关联
media.video 屏幕录制文件(webm格式)
media.frames 每个节点对应的PNG帧图像(包含node_id, t_ms, blob_ref)

数据统计(当前构建版本)

  • 轨迹数:36条
  • 视频与帧:36个视频,共930帧
  • 公司数量:6个
  • 环境分布
    • browser-os:9条
    • macos-web-next:8条
    • windows-web-next:19条

数据生成方式

轨迹基于低层输入(low_level_input)生成,捕获过程中未使用高层应用变异(no high-level app mutation),确保观测结果具有因果性。目标扩展为节点树,终端节点驱动真实桌面模拟器应用(如 Terminal、Notes、VS Code、Browser、Slack/Teams、Mail、Sheets、Slides 等)完成低层鼠标/键盘输入。

搜集汇总
数据集介绍
synthux-economy-r5-w047 数据集图片
构建方式
SynthUX-Economy-R5-W047 数据集源自 SynthUX 生成框架,通过模拟多公司经济体系中的桌面设备会话构建而成。每个记录对应一名虚拟工作者在模拟公司中的完整操作轨迹:从自然语言目标出发,系统将其分解为节点树结构,终端节点通过低层级鼠标与键盘输入驱动真实桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、表格处理等),并记录全屏视频及每个节点的关键帧图像。数据生成基于因果观测机制,仅依赖低层级输入进行状态变更,确保轨迹的真实性与一致性。
特点
该数据集具备多应用原生执行、无工作台覆盖层、跨操作系统消息传递及大规模多公司经济模拟等显著特点。本次发布包含 36 条完整轨迹,涵盖 6 个虚拟公司,涉及 930 帧屏幕截图与 36 段视频记录,横跨浏览器操作系统、macOS 及 Windows 三大模拟环境。每条轨迹均提供细粒度输入事件序列(含时间戳)、因果状态观测以及事件与节点的对齐信息,为计算机使用行为研究提供了丰富且结构化的多模态数据支撑。
使用方法
数据集以 JSON Lines 格式提供核心记录文件 data.jsonl,每条记录包含轨迹标识符、参与者身份、公司归属、角色职位、自然语言目标、节点树结构以及完整的输入事件与观测数据。屏幕截图按轨迹与节点 ID 存储于 screenshots 目录,全屏视频存放于 videos 目录。研究者可依据 trajectory_id 索引对应轨迹,结合节点帧与视频进行多模态分析,或利用输入事件序列与因果状态观测开展人机交互建模与 GUI 代理性能评估。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集由 SynthUX 团队于 2025 年构建,旨在为图形用户界面(GUI)智能体研究提供高保真、多应用协同的计算机使用轨迹数据。在大型语言模型驱动的自动化代理日益普及的背景下,该数据集聚焦于模拟企业环境中员工跨应用(如终端、浏览器、办公套件等)完成自然语言目标的完整操作流程。通过记录低层级的鼠标与键盘事件及屏幕视频,它突破了传统基准测试中单一任务或受限环境的局限,为研究多应用、多操作系统、多角色交互下的智能体行为奠定了基础。该数据集以开源形式发布(Apache-2.0),对计算机使用自动化、人机交互及多智能体系统领域具有重要推动作用。
当前挑战
该数据集的设计与构建面临多重挑战。首先,在领域问题层面,现有 GUI 智能体研究多基于静态截图或高层 API 调用,难以捕捉真实用户操作中的因果动态与意外状态,而 SynthUX 需要还原低层级输入序列与界面反馈间的完整闭环,这对模拟器的真实性与事件同步精度提出了极高要求。其次,构建过程中需解决多应用混合执行的环境复杂性,确保终端、消息、编辑等工具间的跨应用数据流不被工作台覆盖层干扰,同时维护每个员工角色(如 36 条轨迹对应 6 家公司的不同职位)的内容多样性。此外,生成合成数据时,需避免高层级应用突变对因果链条的污染,仅通过低层级输入渠道驱动状态演进,这对模拟器架构与轨迹对齐算法构成了显著技术挑战。
常用场景
经典使用场景
在构建和评估图形用户界面智能体(GUI Agent)的研究中,SynthUX Economy R5 W047 数据集以其独特的模拟企业多用户协作环境而脱颖而出。该数据集的核心使用场景在于为计算机使用任务的自主决策模型提供丰富的训练与测试素材。通过记录模拟公司中不同角色的工作者在跨应用(如终端、笔记、VS Code、浏览器、邮件及即时通讯等)办公场景下的完整操作轨迹,包括鼠标键盘的低级输入事件和屏幕录像,研究者能够利用这些数据来训练具备多应用协调与任务分解能力的智能体。每一条轨迹都从自然语言目标出发,经过节点树规划,最终落地为真实的桌面操作,这为端到端的任务理解与模仿学习提供了标准化的数据基础。
实际应用
在实际产业应用层面,SynthUX Economy R5 W047 数据集扮演了企业级自动化方案研发的标尺与燃料。基于该数据所训练的GUI智能体,能够显著降低企业运营中对重复性数字化劳动的人力依赖,例如自动化处理跨系统的数据录入、会议纪要整理或代码库维护等繁琐环节。这些应用场景不仅限于IT支持,更扩展至财务对账、人力资源报表生成以及项目管理中的多平台信息同步。此外,模拟经济环境中多公司、多角色的数据分布,使得对于办公软件交互可访问性的测试与优化成为可能,为开发更便捷、更智能的数字工作助手提供了坚实的实证依据,从而推动企业生产力工具的智能化跃迁。
衍生相关工作
该数据集的发布催生了一系列引人瞩目的衍生工作。一方面,研究者基于其丰富的轨迹数据开发了面向多应用操作环境的视觉-语言-动作联合预训练模型,这些模型在零样本跨界面迁移任务中展现出惊人的涌现能力。另一方面,该数据集启发了模拟经济环境的对抗性训练框架,其中智能体之间通过内部协作与竞争生成更复杂、更具挑战性的交互场景,极大地增强了决策策略的鲁棒性。此外,基于该数据对界面元素定位与动作序列生成技术的解耦研究也大量涌现,形成了如桌面操作检测、动态流程规划等子课题,最终推动了关于数字工作流自主执行这一方向的系统性知识体系构建,相关成果已频繁发表于顶级人工智能会议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务