遇见数据集

synthux-economy-r5-w054

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX Computer-Use Dataset 是一个基于视觉的计算机使用轨迹合成数据集,专注于经济模拟场景(economy sim r5)。该数据集由 SynthUX 生成,旨在模拟真实工作环境中用户与多应用程序桌面交互的轨迹。每个数据记录代表一个虚拟工作者在模拟公司内的设备会话:自然语言目标被扩展为节点树,终端节点通过低级别鼠标和键盘输入驱动真实的桌面模拟器应用程序(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。交互轨迹被记录为屏幕视频以及每个终端节点在最后输入事件时刻的截图帧。数据集包含三个部分:data.jsonl 文件(每条轨迹对应一个 JSON Lines 记录)、screenshots/ 目录(存储每个轨迹中每个终端节点的 PNG 格式截图)和 videos/ 目录(存储完整的屏幕录制视频,WebM 格式)。记录模式详细定义了多个字段,如轨迹唯一标识、参与者信息、模拟器环境、自然语言目标、节点树结构、低级别输入事件序列、因果观察状态、对齐信息和媒体引用。数据规模为36条轨迹,对应36个视频和1090个截图帧,涉及6个不同的模拟公司,并按模拟环境分布(browser-os 12条、macos-web-next 15条、windows-web-next 9条)。数据集采用应用原生多应用程序执行模式,无工作台覆盖,支持跨操作系统消息传递,并模拟大型多公司经济环境。该数据集适用于图形用户界面(GUI)智能体训练、计算机使用行为分析、多任务自动化以及人机交互研究等任务,特别适合需要低级别输入事件和屏幕视觉观察的强化学习或模仿学习场景。数据生成过程中仅使用低级别输入作为突变通道,未依赖高级别应用程序突变,确保了观察的因果性。

The SynthUX Computer-Use Dataset is a vision-based synthetic dataset of computer-use trajectories, focusing on economy simulation scenarios (economy sim r5). It is generated by SynthUX to simulate user interactions with multi-application desktops in real work environments. Each data record represents a device session of a virtual worker within a simulated company: a natural language goal is expanded into a node tree, with terminal nodes driving real desktop simulator applications (including terminal, notes, VS Code, browser, Slack/Teams, email, spreadsheets, slides, etc.) via low-level mouse and keyboard inputs. The observed interaction trajectories are recorded as screen videos and screenshot frames for each terminal node at the moment of the final input event. The dataset consists of three parts: 1) a data.jsonl file with one JSON Lines record per trajectory, 2) a screenshots/ directory storing PNG-format screenshots for each terminal node in each trajectory, and 3) a videos/ directory storing complete screen recording videos in WebM format. The recording schema defines multiple fields, including a unique trajectory identifier, participant information (e.g., company, role, position), simulator environment (macos-web-next, windows-web-next, or browser-os), natural language goal, node tree structure, low-level input event sequences, causal observation states, alignment information, and media references. This version includes 36 trajectories, corresponding to 36 videos and 1090 screenshot frames, involving 6 different simulated companies, and distributed across simulation environments (browser-os 12, macos-web-next 15, windows-web-next 9). The dataset employs an application-native multi-application execution mode without workbench overlays, supports cross-OS messaging, and simulates a large-scale multi-company economy. Each independent economy simulation is released as a separate dataset repository. It is suitable for tasks such as graphical user interface (GUI) agent training, computer-use behavior analysis, multi-task automation, and human-computer interaction research, particularly for reinforcement learning or imitation learning scenarios requiring low-level input events and screen visual observations. The data generation process uses only low-level inputs as mutation channels, avoiding high-level application mutations to ensure causal observability.

创建时间:
2026-05-30
原始信息汇总

数据集概述

数据集名称:SynthUX Computer-Use (economy sim) r5

许可证:Apache-2.0

任务类别:其他

标签:计算机使用、GUI代理、合成数据、多应用

数据集描述

该数据集包含由 SynthUX 生成的基于视觉的计算机使用轨迹。每条记录对应模拟公司中一名员工的设备会话:一个目标展开为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),并记录观察到的轨迹,包括屏幕视频和每个节点的帧。

特点

  • 应用原生多应用执行(无工作台覆盖)
  • 每个角色的内容多样性
  • 跨操作系统的消息传递
  • 大型多公司经济体

数据集内容

  • data.jsonl:每条渲染轨迹的记录。
  • screenshots/<trajectory>/<node_id>.png:每个终端节点在其最后一次输入事件时的帧。
  • videos/<trajectory>.webm:完整的屏幕录制。

记录模式

字段 含义
trajectory_id 唯一 ID(<actor>__<env>
actor_id, company, role_id, title 谁,在哪个组织中
env 模拟器:macos-web-next / windows-web-next / browser-os
goal 会话的自然语言目标
tree.nodes 角色的终端节点(surface, action, target, args
trajectory.input_events 密集的底层鼠标/键盘/脚本事件,附带 t_ms
trajectory.observations 每个节点后的因果模拟器状态
trajectory.alignment 将观察结果和输入事件范围链接到节点 ID
media.video 屏幕录制(webm)
media.frames 每节点的 PNG 帧(node_id, t_ms, blob_ref)

统计信息(当前构建)

  • 轨迹数量:36
  • 视频数量:36 · 帧数量:1090
  • 公司数量:6
  • 按环境分布:browser-os(12),macos-web-next(15),windows-web-next(9)

来源

使用 SynthUX(synthux.multicompany.day.v1)生成。观察结果是因果性的(突变通道 = low_level_input);捕获过程中未使用高级应用突变。

搜集汇总
数据集介绍
synthux-economy-r5-w054 数据集图片
构建方式
该数据集名为SynthUX Computer-Use (economy sim),由SynthUX框架生成,专注于模拟多应用环境下的计算机使用轨迹。其构建方式基于多公司经济模拟:每位工作者的设备会话被记录在一个模拟公司中,一个自然语言目标被扩展为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等)。每个节点对应一次输入事件,完整轨迹被记录为屏幕视频及每节点帧图像。数据集的每个经济模拟版本独立发布,本版本为第5轮(r5),共包含36条轨迹,涵盖6个模拟公司,运行于macos-web-next、windows-web-next及browser-os三种模拟环境。
特点
该数据集的核心特点在于其原生多应用执行模式:无工作台叠加层,直接通过底层输入驱动各个独立应用,确保了轨迹的真实性与交互的完整性。数据内容具有高度多样性,体现在每个角色拥有独立的身份与内容,且支持跨操作系统消息传递。构建过程中采用因果观察机制,即所有观测状态均源于底层输入事件的变化,而非高层应用突变,保证了数据因果链条的纯净性。数据集包含丰富的媒体资源:每条轨迹对应一个全屏WebM视频,以及每个终端节点在最后输入事件时刻的PNG帧图像,共计1090帧,为细粒度分析提供了视觉支撑。
使用方法
该数据集主要用于训练和评估具有图形用户界面(GUI)操作能力的智能体模型。使用方法上,研究人员可加载`data.jsonl`文件,每条记录包含轨迹ID、角色与公司信息、自然语言目标、节点树结构、底层输入事件序列、因果观测状态及事件对齐关系。媒体文件按轨迹组织于`screenshots/`和`videos/`目录下,可通过`media.video`和`media.frames`字段中的索引引用。建议采用序列建模方法处理输入事件与观测序列,结合视觉帧进行多模态学习,以复现或预测用户在复杂多应用办公环境中的操作轨迹。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim)数据集由研究团队于2025年基于SynthUX框架生成,旨在探索多应用、多角色协同的图形用户界面(GUI)代理在模拟经济场景中的视觉交互能力。该数据集通过构建包含36条轨迹、1090帧图像及对应屏幕录像的虚拟企业环境,覆盖6家模拟公司及多种操作系统环境(macOS、Windows、浏览器),为GUI代理系统提供细粒度、低层级的人机交互数据。其核心研究问题在于如何利用合成数据驱动复杂的多步任务执行与跨应用通信,为自动化办公、企业流程模拟等领域提供基准,填补了现有数据集在真实桌面环境多应用协作方面的空白,对智能代理在电子商务、金融仿真等场景的泛化能力提升具有重要推动作用。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,GUI代理需解决从自然语言目标到低层级鼠标键盘操作的精准映射,在无工作台覆盖的纯原生应用中执行多步任务并保持状态一致性,同时处理跨操作系统消息传递与多公司经济生态的动态交互。构建过程层面,需克服合成轨迹的因果一致性,确保每个低层级输入事件与模拟器状态的演化严密对齐,避免因应用状态突变导致的动作失效;此外,如何在有限轨迹数(36条)下保证内容多样性、覆盖边缘用例,以及平衡不同操作系统环境下交互模式的差异,是数据集质量保障的关键难点。
常用场景
经典使用场景
在计算机视觉与智能体交互研究的交汇处,SynthUX经济仿真数据集为多应用GUI代理系统的训练与评估提供了精细化的数据支撑。该数据集记录了模拟公司内员工在真实桌面环境(如macOS、Windows及浏览器)中执行复杂任务的全过程,涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件及办公套件等多应用协同操作。每一轨迹均以屏幕视频与逐节点帧图的形式保存,配合低层级鼠标/键盘输入事件与因果状态观测,使研究者能够复现并学习人类在跨应用工作流中的视觉决策模式。经典使用场景聚焦于构建端到端的视觉语言模型,使其能够理解截图上下文并生成可执行的GUI操作序列,从而在仿真经济活动中自动完成数据录入、跨系统消息传递等复合任务。
解决学术问题
该数据集直面多应用GUI自动化领域中长期存在的两大难题:异构环境下的跨应用操作对齐与大规模多智能体经济系统中的轨迹多样性生成。传统基准多聚焦于单应用或单一操作系统内的孤立任务,而SynthUX通过引入多公司、多角色、多操作系统的仿真经济场景,构建了包含36条轨迹、1090帧画面的结构化数据,每个轨迹均附带目标树、密集输入事件与帧级对齐标注。这使学术界得以系统研究因果观测条件下的视觉推理问题,例如如何从屏幕截图推断前序操作意图,或如何在低层级输入扰动中保持任务目标的稳定性。其意义在于将GUI代理从封闭的沙盒实验推向更具生态真实性的多应用协同场景,为构建能够在复杂数字办公环境中自主导航的通用智能体奠定了数据基础。
衍生相关工作
SynthUX数据集的发布催生了一系列前沿研究方向。在数据生成层面,其因果观测与可微分操作通道的设计启发了后续工作者探索基于逆强化学习的轨迹优化方法,旨在从稀疏目标逆向推导更高效的输入序列。在模型架构层面,研究者借鉴其帧-事件对齐结构,开发了融合视觉Transformer与时间序列编码器的多模态代理模型,能够在长时序任务中维持状态追踪与错误恢复能力。此外,数据集所体现的多公司经济仿真理念被扩展为一种通用的评估范式,衍生出诸如跨组织消息传递基准与动态角色切换任务集等标准化测试套件,推动社区从单一任务成功率转向对代理生态适应性与鲁棒性的系统度量。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务