遇见数据集

synthux-economy-r5-w043

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集—经济模拟r5是一个由SynthUX生成的、基于视觉的计算机使用轨迹数据集,专注于模拟公司环境中的工作会话。该数据集旨在通过低级鼠标和键盘输入,在真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)中驱动任务执行,并记录完整的交互轨迹。每个记录代表一个参与者在模拟公司设备会话中的活动:一个自然语言目标被扩展为节点树,终端节点通过输入事件控制应用程序,观察轨迹以屏幕视频和每个节点的静态帧形式捕获。数据集支持多应用程序原生执行(无工作台覆盖),具有每个参与者的内容多样性、跨操作系统消息传递和大型多公司经济模拟,每个经济模拟作为独立的数据集仓库发布。数据集包含36个轨迹、36个视频和968帧,覆盖6个公司,环境分布包括 browser-os(10)、macos-web-next(12)和 windows-web-next(14)。数据文件包括 data.jsonl(每条轨迹的JSON行记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点在最后输入事件时的PNG帧)和 videos/<trajectory>.webm(WebM格式的完整屏幕录制)。记录模式详细说明了轨迹ID、参与者信息、公司、角色、环境、目标、树节点(表面、动作、目标、参数)、输入事件(带时间戳的低级事件)、观察(因果模拟器状态)、对齐(链接观察和事件到节点)以及媒体引用。该数据集适用于计算机使用、GUI代理、合成数据和多应用程序交互的研究与开发,特别适合训练和评估基于视觉的自动化代理或人机交互系统。观察基于因果模拟器状态,突变通道仅使用低级输入,未使用高级应用程序突变。

SynthUX Computer Usage Dataset—Economic Simulation r5 is a vision-based computer usage trajectory dataset generated by SynthUX, focusing on simulating work sessions in corporate environments. This dataset aims to drive task execution in real desktop simulator applications (such as terminals, notes, VS Code, browsers, Slack/Teams, email, spreadsheets, slides, etc.) via low-level mouse and keyboard inputs, and record complete interaction trajectories. Each record represents the activity of a participant during a simulated corporate device session: a natural language target is expanded into a node tree, where terminal nodes control applications through input events, and the interaction trajectory is captured as screen videos and static frames for each node. The dataset supports native execution across multiple applications (no workspace overlay), features content diversity for each participant, cross-operating system messaging, and large-scale multi-corporate economic simulations, with each economic simulation released as an independent dataset repository. The dataset contains 36 trajectories, 36 videos, and 968 frames, covering 6 companies, with environment distributions including browser-os (10), macos-web-next (12), and windows-web-next (14). The data files include data.jsonl (JSON Lines records for each trajectory), screenshots/<trajectory>/<node_id>.png (PNG frames of each terminal node at the time of its final input event), and videos/<trajectory>.webm (full screen recordings in WebM format). The record schema details trajectory ID, participant information, company, role, environment, target, tree nodes (surface, action, target, parameter), input events (low-level events with timestamps), observations (causal simulator states), alignments (linking observations and events to nodes), and media references. This dataset is applicable to research and development in computer usage, GUI agents, synthetic data, and multi-application interaction, and is particularly suitable for training and evaluating vision-based automated agents or human-computer interaction systems. Observations are based on causal simulator states, and mutation channels only use low-level inputs without leveraging high-level application mutations.

创建时间:
2026-05-30
原始信息汇总

数据集概述:SynthUX Computer-Use (economy sim r5)

基本信息

  • 许可证:Apache-2.0
  • 任务类别:其他
  • 标签:计算机使用、GUI代理、合成数据、多应用
  • 数据集名称:SynthUX Computer-Use (economy sim)

数据集描述

该数据集包含由 SynthUX 生成的基于视觉的计算机使用轨迹。每条记录代表模拟公司中一名员工的设备会话:一个目标扩展为节点树,终端节点通过底层鼠标/键盘输入驱动真实的桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频和每节点帧。

特点包括:

  • 应用原生的多应用执行(无工作台覆盖)
  • 每个参与者的内容多样性
  • 跨操作系统消息传递
  • 大型多公司经济模拟

每个经济模拟作为独立的数据集仓库发布。

数据集内容

  • data.jsonl:每条渲染轨迹的记录
  • screenshots/<trajectory>/<node_id>.png:每个终端节点的帧,取自该节点最后一个输入事件
  • videos/<trajectory>.webm:完整的屏幕录制视频

记录模式(Schema)

字段 含义
trajectory_id 唯一ID (<actor>__<env>)
actor_id, company, role_id, title 员工身份及所属组织
env 模拟器类型:macos-web-next / windows-web-next / browser-os
goal 会话的自然语言目标
tree.nodes 参与者的终端节点(包含 surface, action, target, args
trajectory.input_events 密集的底层鼠标/键盘/脚本事件,附带 t_ms
trajectory.observations 每个节点后的因果模拟器状态
trajectory.alignment 将观察结果和输入事件范围链接到节点ID
media.video 屏幕录制(webm 格式)
media.frames 每节点 PNG 帧(包含 node_id, t_ms, blob_ref)

数据集统计(当前构建版本)

  • 轨迹数量:36 条
  • 视频数量:36 个,帧数共计 968 帧
  • 公司数量:6 家
  • 按环境分布
    • browser-os:10 条
    • macos-web-next:12 条
    • windows-web-next:14 条

数据来源

数据由 SynthUX 生成(版本:synthux.multicompany.day.v1)。观察结果为因果关系(突变通道 = low_level_input),捕获过程中未使用高级应用突变。

搜集汇总
数据集介绍
synthux-economy-r5-w043 数据集图片
构建方式
该数据集基于SynthUX框架生成,模拟了多公司经济体系中的计算机使用轨迹。每个记录源自一名员工在仿真公司内部的设备会话:自然语言目标被展开为节点树,终端节点通过底层鼠标/键盘操作驱动真实的桌面模拟器应用(如终端、记事本、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。系统记录观察到的轨迹,生成屏幕视频及每节点帧。所有轨迹均为因果性采集,仅依赖低层级输入变异通道,避免高层应用干预。
使用方法
数据以JSONL格式存储,每条记录包含轨迹ID、参与者信息、目标、节点树、密集的低层级输入事件序列、因果性模拟器状态、观测与节点ID的对应关系。媒体文件以WebM视频和PNG帧形式提供,分别存放于videos/和screenshots/目录下。用户可通过加载data.jsonl文件解析每条轨迹,结合对应截图和视频进行GUI代理模型的训练与评估,或分析多应用场景下的用户行为模式。
背景与挑战
背景概述
在图形用户界面(GUI)智能代理领域,构建能够理解并操作真实桌面环境的多应用交互系统是当前的研究热点。SynthUX Computer-Use数据集由SynthUX团队于近期创建,聚焦于模拟企业经济环境下的多应用计算任务。该数据集通过生成式方法,在每个记录中模拟一名工作者在虚拟公司内的设备会话,涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件、电子表格和演示文稿等多种应用程序,并通过底层鼠标与键盘操作记录完整的屏幕视频和逐节点帧。其设计突破了传统单应用或单一操作系统的局限,引入了跨操作系统消息传递和多公司经济体系,为推动通用GUI代理的跨应用、跨平台能力提供了全新的基准资源。该数据集以Apache-2.0许可发布,共计36条轨迹、968帧图像,覆盖macOS、Windows及浏览器三种环境,对研究多应用协作与复杂任务分解具有重要影响力。
当前挑战
SynthUX数据集致力于解决GUI代理领域多应用协同与真实环境交互的核心挑战。一方面,领域问题层面,现有智能代理通常局限于单一应用或简化环境,难以应对真实用户任务中跨应用数据流转、上下文切换及多步操作依赖的复杂性;该数据集通过模拟包含不同角色、公司及经济活动的企业场景,迫使代理学习从高层目标到低层输入事件的端到端规划与执行,并处理跨操作系统的界面差异。另一方面,构建过程中面临严峻挑战:需要确保每个会话的轨迹自然且多样,同时保持不同公司间内容的一致性与差异性;生成底层输入事件时,必须精确映射到模拟器状态以避免高层面板覆盖干扰;此外,通过仅依赖低层输入作为变异通道来保证观察的因果性,在保证数据规模的同时需严格控制状态一致性,这些技术难题均对数据集的可靠性与可复现性提出了高要求。
常用场景
经典使用场景
在计算机自主交互与图形用户界面智能体的研究领域中,SynthUX Economy R5 W043数据集扮演着举足轻重的角色。该数据集的核心价值在于其提供了跨越多个操作系统环境的、基于真实桌面模拟的计算机使用轨迹,涵盖了终端、浏览器、办公套件、通讯软件等多应用协同操作场景。经典使用场景聚焦于利用这些细粒度的鼠标与键盘输入事件序列,以及对应的屏幕视频与逐节点截图,来训练和评估能够根据自然语言目标自主完成复杂跨应用任务的GUI智能体。研究员可借助该数据集训练模型理解用户意图与底层交互动作间的映射关系,从而推动计算机使用自动化技术的发展。
解决学术问题
此数据集精准地回应了计算机科学领域内一个迫切的学术挑战:如何构建具备跨应用、跨平台操作能力的通用型GUI智能体。以往的研究多受限于单一应用环境或过度简化的模拟界面,难以捕捉真实世界中多窗口协作、跨应用数据流转等复杂交互的本质。通过记录公司模拟环境中不同角色的完整操作流程,该数据集为研究多步骤任务规划、视觉-动作因果推理、以及面向不同操作系统(macOS、Windows与浏览器)的策略泛化问题提供了坚实的数据基础。其重要性在于弥合了模拟环境与实际桌面操作之间的现实落差,为开发能够在复杂商业场景中稳定运行的智能体奠定了数据基石。
实际应用
该数据集的实践价值深植于企业级自动化的广阔前景之中。其记录的多公司、多角色会话场景,直接对应了真实商业环境中员工利用各类软件完成日常工作的流程。从财务对账、代码部署到跨部门邮件沟通,数据集中蕴含的轨迹可被用来微调大语言模型或视觉-语言模型,使其掌握诸如在Slack中确认任务后于VSCode中修改代码、再通过终端执行测试等端到端操作。这些能力可转化为智能办公助手产品,通过自动化繁琐的信息录入、软件配置与报表生成等工作,显著提升知识工作者的生产效率,并降低人为操作带来的错误率。
数据集最近研究
最新研究方向
面向多应用协同的GUI智能体工作流模拟与评估。该数据集通过细粒度的设备操作轨迹与节点级帧记录,为研究经济模拟场景下计算机使用智能体的行为对齐、跨平台交互与多角色协作提供了标准化基准。其热点方向聚焦于利用合成数据驱动的方法,在仿真公司环境中评测智能体执行自然语言任务时的视觉-动作一致性,从而推动GUI自动化在复杂企业生态系统中的应用可信度与可扩展性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务