遇见数据集

jacob-valdez/synthux-economy-r2-w021

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集——经济模拟r2是一个由SynthUX生成的基于视觉的计算机使用轨迹数据集。每个记录代表一个工人在模拟公司设备会话中的轨迹:目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS代码、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察轨迹被记录为屏幕视频和每节点帧。数据集支持应用原生多应用执行(无工作台覆盖)、每个演员内容多样性、跨操作系统消息传递和大规模多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。内容包括:data.jsonl(每个渲染轨迹一条记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点的帧,在节点最后一个输入事件时拍摄)、videos/<trajectory>.webm(完整屏幕录制)。记录模式包括轨迹ID、演员ID、公司、角色ID、标题、环境、目标、树节点、轨迹输入事件、观察结果、对齐和媒体文件。本构建统计:轨迹36个、视频36个、帧996个、公司6个,按环境分布:browser-os(14)、macos-web-next(12)、windows-web-next(10)。数据集使用SynthUX生成,观察结果是因果性的(突变通道为低级输入),捕获过程中未使用高级应用突变。

SynthUX Computer-Use Dataset — economy sim r2 is a grounded visual computer-use trajectories dataset generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo. Contents include: data.jsonl (one record per rendered trajectory), screenshots/<trajectory>/<node_id>.png (a frame per terminal node, taken at that nodes last input event), videos/<trajectory>.webm (the full screen recording). Record schema covers trajectory_id, actor_id, company, role_id, title, env, goal, tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, and media. Stats for this build: trajectories: 36, videos: 36, frames: 996, companies: 6, by env: browser-os (14), macos-web-next (12), windows-web-next (10). Generated with SynthUX, observations are causal (mutation channel = low_level_input); no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r2-w021 数据集图片
构建方式
该数据集由SynthUX框架生成,模拟了多公司经济环境中的计算机使用轨迹。每条记录对应一个模拟公司内工作者的设备会话:一个自然语言目标被展开为节点树,终端节点通过低级别鼠标与键盘输入驱动真实的桌面模拟器应用(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观测到的轨迹以屏幕视频及逐节点帧的形式被记录。数据生成遵循因果原则,仅通过低级别输入通道改变模拟器状态,未使用高级应用变异手段。
特点
数据集具有多重特性:原生多应用执行环境,无需覆盖工作台即可操作;每位参与者内容具有多样性,并支持跨操作系统消息通信;构建于大型多公司经济模拟之上,每个经济体发布为独立的数据集仓库。本次发布包含36条轨迹、996帧图像、6家模拟公司,覆盖浏览器操作系统、macOS及Windows三种模拟环境,展现了丰富的跨平台与多应用交互场景。
使用方法
数据集以JSONL格式存储,每条记录包含轨迹ID、参与者角色信息、模拟环境类型、自然语言目标、终端节点详情及低级别输入事件序列。配套资源包括每节点PNG帧图像(存放于screenshots目录)和全屏幕录像WebM文件(存放于videos目录)。用户可解析data.jsonl文件获取结构化轨迹数据,结合图像与视频资源进行计算机使用行为分析、GUI代理训练或交互仿真研究。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集由 SynthUX 研究团队于近期创建,旨在解决图形用户界面(GUI)代理在复杂多应用环境中的交互建模问题。该数据集通过模拟多公司经济生态,生成了包含自然语言目标、底层鼠标键盘事件及屏幕录制的高保真计算机操作轨迹。其核心研究问题在于如何构建能够理解并执行跨应用任务(如终端、浏览器、办公软件等)的视觉型GUI代理,为人工智能系统从模拟环境向真实桌面场景的迁移学习提供了关键基准。该数据集以其多公司、多角色、多操作系统的多样化内容设计,显著推动了计算机使用任务中可控模拟与现实应用之间的桥梁构建,对AI代理与图形界面交互领域的学术研究具有重要影响力。
当前挑战
该数据集所解决的领域问题在于GUI代理训练中面临的三大挑战:一是真实桌面环境的复杂性和任务多样性,需要代理同时操作多个原生应用并处理跨系统消息;二是从高层自然语言目标到低层连续操作序列的映射难题,涉及稀疏语义奖励与密集动作空间的对齐;三是模拟数据与实际应用之间的泛化鸿沟,要求数据集具备可扩展的经济仿真与角色多样性。在构建过程中,SynthUX团队面临生成因果可观测轨迹的技术挑战,需确保模拟器中节点树展开与终端操作的严格因果关系,同时维持每帧图像的视觉保真度,并协调macOS、Windows及浏览器等多环境下的输入事件记录一致性,以保证数据集的高质量与实用性。
常用场景
经典使用场景
SynthUX Economy R2 W021数据集在GUI智能体研究领域占据独特地位,其核心价值在于为多应用协同操作提供高度仿真的训练与评估平台。该数据集精心记录了模拟公司环境中不同角色的完整计算机使用轨迹,涵盖终端、笔记、代码编辑器、浏览器、通讯软件、邮件及办公套件等多种桌面应用。每个轨迹均以自然语言目标为起点,逐层展开为可执行的原子动作节点,并通过低层级鼠标与键盘事件驱动真实的桌面模拟器,最终生成带时间戳的密集输入序列、因果状态观察以及完整屏幕录像。研究者可基于这些对齐良好的多模态数据,训练具备跨应用任务分解与执行能力的视觉语言模型,或评估现有GUI智能体在复杂多步骤工作流中的规划与泛化表现。
衍生相关工作
作为SynthUX生成式数据集生态的重要组成部分,Economy R2 W022版本及后续迭代已激发多项前沿探索工作。研究者基于该数据集的细粒度轨迹对齐方式,提出了多模态因果动作分割方法,能够在连续屏幕录像中精准定位各原子操作对应的视觉状态变化区间。另有团队借鉴其多公司、多角色的组织编排逻辑,开发了可参数化配置的企业仿真数据生成框架,通过调整公司规模、部门结构与通讯协议,实现特定行业场景(如金融合规审核、医疗病历流转)的定制化轨迹合成。该数据集的因果观测机制也催生了面向GUI智能体的可解释性研究,学者借助其因果状态追踪特性,设计出可对智能体失败决策进行根源回溯的反事实分析工具。这些衍生工作共同勾勒出以高保真、因果化、多应用仿真数据为核心的GUI智能体研究新范式。
数据集最近研究
最新研究方向
该数据集聚焦于图形用户界面(GUI)代理在复杂多应用环境中的计算机操作轨迹生成与仿真,属于前沿的智能体交互研究方向。通过模拟真实企业场景中的多公司经济活动,数据集记录了包括终端、浏览器、办公软件等在内的跨应用操作序列,为研究多步骤、多目标的任务规划与执行提供了高保真的视觉和操作数据。这一方向与当前大语言模型驱动的自动化代理热点紧密相关,尤其在金融、客户服务等需要跨系统信息整合的行业具有重要应用价值,推动了对智能体在真实桌面环境中语义理解、错误恢复及长期依赖建模的评估与优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务