遇见数据集

jacob-valdez/synthux-economy-r2-w020

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r2)是一个基于模拟环境的计算机使用轨迹数据集,由SynthUX生成。每个记录代表一个工作人员在模拟公司设备会话中的活动:目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频加上每个节点的帧。数据集特点包括应用原生多应用程序执行(无工作台覆盖)、每个参与者内容多样性、跨操作系统消息传递以及大型多公司经济模拟。每个经济模拟作为独立的数据集存储库发布。数据内容包括JSONL格式的记录、每个轨迹的屏幕截图(每节点一帧)和完整屏幕录制视频。记录模式涵盖轨迹ID、参与者信息、环境、目标、节点树、输入事件、观察结果、对齐信息以及媒体引用。本构建包含36个轨迹、991帧、6家公司,环境分布为browser-os(10)、macos-web-next(15)和windows-web-next(11)。数据来源为SynthUX(synthux.multicompany.day.v1),观察结果基于因果关系(突变通道为低级别输入),捕获过程中未使用高级别应用程序突变。

许可证:Apache-2.0 任务类别:其他 标签:计算机交互(computer-use)、GUI智能体(gui-agents)、合成数据(synthetic)、多应用(multi-application) 友好名称:SynthUX计算机交互(经济模拟版) # SynthUX计算机交互数据集——经济模拟版r2 本数据集包含由SynthUX生成的基于视觉锚定的计算机交互轨迹。每条记录对应一名员工在模拟企业中的设备会话:任务目标会展开为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(终端、备忘录、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),记录的交互轨迹包含屏幕录制视频及各节点对应的帧画面。 该数据集支持原生多应用执行(无工作台覆盖层)、参与者内容多样性、跨操作系统消息传递以及大型多企业经济模拟。每个经济模拟版本均以独立数据集仓库形式发布。 ## 内容说明 - `data.jsonl`:每条渲染轨迹对应一条记录。 - `screenshots/<trajectory>/<node_id>.png`:每个终端节点的帧画面,采集于该节点的最后一次输入事件时刻。 - `videos/<trajectory>.webm`:完整屏幕录制视频。 ## 记录模式 | 字段 | 含义 | |---|---| | `trajectory_id` | 唯一标识符(格式为`<actor>__<env>`) | | `actor_id`、`company`、`role_id`、`title` | 参与者所属组织及身份信息 | | `env` | 模拟器类型:`macos-web-next` / `windows-web-next` / `browser-os` | | `goal` | 本次会话的自然语言任务目标 | | `tree.nodes` | 参与者的终端节点(包含`surface`、`action`、`target`、`args`字段) | | `trajectory.input_events` | 包含时间戳`t_ms`的高密度底层鼠标、键盘及脚本输入事件 | | `trajectory.observations` | 每个节点执行后的模拟器因果状态 | | `trajectory.alignment` | 将观测结果与输入事件范围关联至节点ID的映射关系 | | `media.video` | 屏幕录制视频(格式为webm) | | `media.frames` | 各节点的PNG帧画面(包含`node_id`、`t_ms`、`blob_ref`字段) | ## 本次构建版本统计数据 - 交互轨迹总数:**36** - 视频总数:36 · 帧画面总数:991 - 企业总数:6 - 按模拟器类型分布:browser-os(10)、macos-web-next(15)、windows-web-next(11) ## 数据溯源 本数据集由SynthUX(synthux.multicompany.day.v1)生成。观测结果基于因果逻辑(数据变更通道为底层输入),采集过程中未使用任何高层级应用修改操作。

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r2-w020 数据集图片
构建方式
SynthUX Economy R2 W020数据集源于对现代企业数字化办公环境的深度模拟,旨在为计算机视觉与GUI智能体研究提供真实可循的轨迹数据。数据集构建通过SynthUX生成框架实现,每个记录对应模拟公司中一名员工的设备会话。一个自然语言目标被扩展为节点树,终端节点通过低层级鼠标与键盘操作驱动桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格处理及演示文稿等),完整记录下观察到的操作轨迹,最终以屏幕视频及节点帧的形式保存。每条轨迹均承载原生多应用执行、跨演员内容多样性及跨操作系统的消息交互,并基于大型多公司经济体进行构建,每次经济模拟独立发布为单独的数据集仓库。
特点
该数据集具备应用原生多应用执行能力,不依赖工作台覆盖层,确保操作轨迹的纯正性与真实性。每位演员的内容具有多样性特征,且支持跨操作系统的消息交互,模拟了大型多公司经济体的复杂环境。数据集包含36条轨迹、991帧图像及6家模拟公司的数据,覆盖macOS Web、Windows Web及浏览器操作系统三种环境,分布均衡。每条轨迹均提供密集的低层级键盘与鼠标事件、因果观察状态及观察结果与输入事件的节点对齐信息,同时配有完整的屏幕录像(WebM格式)与每节点截图(PNG格式),为细粒度行为分析与模型训练提供了丰富可靠的素材。
使用方法
用户可直接从数据集的data.jsonl文件中读取每条轨迹的结构化记录,包含轨迹标识符、演员信息、环境类型、自然语言目标、节点树及完整事件序列。通过关联screenshots目录下的节点帧与videos目录下的屏幕录像,可进行视觉与行为数据的联合分析。适用于训练GUI智能体执行多应用任务、评估跨平台操作一致性、构建模拟经济体的行为模型等场景。数据集采用Apache 2.0许可,便于研究社区广泛使用与扩展,可通过HuggingFace Datasets库便捷加载并进行下游任务的端到端实验。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim r2)数据集由SynthUX团队于2023年创建,专注于多应用桌面环境中的图形用户界面代理研究。该数据集通过模拟多公司经济体中的员工设备会话,收集了36条完整的视觉计算轨迹,涵盖macOS、Windows及浏览器三种操作系统环境。每条轨迹记录了从自然语言目标到低层级鼠标/键盘操作的完整推理链条,包含991个节点帧和对应屏幕录像。其核心研究问题在于探索如何基于合成数据训练能够理解跨应用工作流的智能体,对计算机使用自动化、企业流程模拟与人机协作领域具有重要推动作用,尤其为GUI代理的底层感知与决策提供了结构化基准。
当前挑战
该数据集当前面临的挑战集中于三个层面:首先,在领域问题层面,多应用经济体中的GUI交互具有高度动态性与异质性,智能体需同时理解不同操作系统(macOS/Windows)的界面差异、跨应用协作(如Slack与VS Code联动)的隐含语义,以及自然语言目标到原子操作序列的复杂映射,这对模型的长期依赖建模与泛化能力构成严峻考验。其次,在构建过程中,数据集需确保轨迹的因果一致性——仅通过低层级输入驱动应用状态变化,避免高层接口的捷径干扰;同时需维持跨公司角色的内容多样性(6个公司、不同角色与目标)以避免数据偏差。此外,合成数据的生态效度(如模拟用户行为的真实性)与960帧级标注成本之间的平衡仍是未解决的关键瓶颈。
常用场景
经典使用场景
SynthUX-Economy-R2-W020数据集专为多应用协同的GUI智能体研究而设计,其核心使用场景是模拟企业环境中工人在真实桌面操作系统(macOS、Windows)及浏览器上执行复杂、多步骤任务的完整轨迹。每个样本记录了一个虚拟员工的设备会话,涵盖从自然语言目标分解为原子操作树,再通过低层级鼠标和键盘输入驱动终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等原生应用程序的完整过程。该数据集提供了密集的输入事件流、因果观测状态及对齐标注,为训练和评估能够跨应用、跨平台自主完成长周期任务的计算机使用智能体提供了高质量的、可复现的基准数据。
实际应用
在实际应用中,该数据集可被用于开发与评测可部署于企业办公环境的虚拟助手。借助其涵盖6家公司、36条完整会话轨迹的数据基础,工程师能够训练智能体在真实桌面应用程序(如VS Code编码、Slack沟通、邮件收发、Sheets数据录入)中根据自然语言指令自主执行信息检索、文档编辑、跨应用数据迁移等价值密集的操作。该数据集的低层级事件记录方式和按节点截取的观察帧,还为企业级流程自动化(RPA)工具的智能化升级提供了与用户行为高度一致的训练素材。同时,跨平台(macOS、Windows及浏览器)的覆盖面使得多操作系统兼容性测试和迁移学习成为可能,加速了GUI智能体从实验室原型向产品化落地的进程。
衍生相关工作
该数据集源自SynthUX生成框架,推动了计算机使用智能体研究领域多项经典的衍生工作。基于其多公司、多角色、多应用的设定,研究者构建了企业级任务规划的上下文理解基准,并分析了智能体在组织层级下的决策可解释性与鲁棒性。数据集中因果观测与输入事件的细粒度对齐,激发了面向GUI智能体的隐式状态建模与最小干预策略优化研究。此外,利用该数据集29个终端节点的时序帧,出现了大量关于视觉语言模型在像素级交互指令执行中的微调与评估工作。跨操作系统和多公司经济模拟场景的引入,还催生了面向分布式多智能体协同任务分配与资源共享的仿真框架,进一步拓展了合成数据在实际空域和任务复杂度上的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务