遇见数据集

jacob-valdez/synthux-economy-r3-w023

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集—经济模拟r3是一个基于SynthUX生成的视觉计算机使用轨迹数据集,模拟公司环境中的工作者设备会话。每个记录代表一个工作者的设备会话,其中目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实桌面模拟器应用(如Terminal、Notes、VS Code、Browser、Slack/Teams、Mail、Sheets、Slides等),观察轨迹被记录为屏幕视频和每个节点的帧。数据集支持应用原生多应用执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递以及大型多公司经济模拟,每个经济模拟作为独立的数据集仓库发布。内容包括数据文件、截图和视频,记录模式涵盖轨迹ID、参与者信息、环境、目标、节点树、输入事件、观察结果、对齐和媒体文件。统计信息显示该构建包含36个轨迹、980帧、6个公司,环境分布为browser-os(16)、macos-web-next(15)、windows-web-next(5)。数据来源为SynthUX生成,观察具有因果性(突变通道为低级别输入),捕获过程中未使用高级应用突变。

许可证:Apache-2.0 任务类别: - 其他 标签: - 计算机交互(computer-use) - 图形用户界面智能体(gui-agents) - 合成数据集(synthetic) - 多应用(multi-application) 规范名称:SynthUX 计算机交互(经济模拟版) --- # SynthUX 计算机交互数据集——经济模拟版 r3 本数据集为由SynthUX生成的锚定式视觉计算机交互轨迹。每条记录对应一名员工在模拟企业中的设备会话:任务目标会展开为节点树,终端节点通过底层鼠标/键盘输入驱动真实桌面模拟器应用(终端(Terminal)、备忘录(Notes)、VS Code、浏览器、Slack/Teams、邮件(Mail)、表格(Sheets)、演示文稿(Slides)等),所观测到的交互轨迹会被录制为屏幕视频与逐节点帧图像。 该数据集支持应用原生多应用执行(无工作台叠加层)、参与角色内容多样性、跨操作系统消息传递以及大型多企业经济模拟。每场经济模拟均会作为独立的数据集仓库发布。 ## 内容说明 - `data.jsonl`:每条渲染后的交互轨迹对应一条记录 - `screenshots/<trajectory>/<node_id>.png`:每个终端节点的帧图像,采集于该节点的最后一次输入事件时刻 - `videos/<trajectory>.webm`:完整屏幕录制视频 ## 记录模式(schema) | 字段名 | 含义 | |---|---| | `trajectory_id` | 唯一标识符(格式为`<actor>__<env>`) | | `actor_id`、`company`、`role_id`、`title` | 参与者信息与所属组织 | | `env` | 模拟器类型,可选值为`macos-web-next`、`windows-web-next`或`browser-os` | | `goal` | 会话对应的自然语言任务目标 | | `tree.nodes` | 参与者的终端节点(包含`surface`、`action`、`target`、`args`字段) | | `trajectory.input_events` | 包含时间戳`t_ms`的高密度底层鼠标、键盘与脚本事件 | | `trajectory.observations` | 每个节点执行后的因果模拟器状态 | | `trajectory.alignment` | 将观测数据与输入事件范围关联至节点ID的映射关系 | | `media.video` | 屏幕录制视频(格式为webm) | | `media.frames` | 逐节点PNG帧图像(包含`node_id`、`t_ms`、`blob_ref`字段) | ## 统计信息(当前构建版本) - 交互轨迹总数:**36** - 视频总数:36,帧图像总数:980 - 企业总数:6 - 按模拟器类型分布:browser-os(16条)、macos-web-next(15条)、windows-web-next(5条) ## 数据来源 本数据集由SynthUX(版本为`synthux.multicompany.day.v1`)生成。观测数据为因果式数据(数据变更通道为底层输入);采集过程中未使用任何高层级应用变更操作。

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r3-w023 数据集图片
构建方式
本数据集基于SynthUX框架生成,模拟了一个多公司经济体系中的计算机使用轨迹。每个记录对应一位虚拟员工在模拟公司中的设备会话过程:自然语言目标被解析为节点树,终端节点通过低层级鼠标与键盘操作驱动真实的桌面模拟器应用(如终端、笔记、VS Code、浏览器、即时通讯、邮件、电子表格与演示文稿等),并将观察到的操作轨迹以屏幕视频与逐节点帧的形式加以记录。数据生成采用因果观测机制,仅通过低层级输入突变通道捕获状态,避免高层级应用突变的干扰。
特点
该数据集具备多项突出特点:首先,它实现了应用原生的多应用并行执行,无需工作台覆盖层的介入;其次,通过逐角色内容多样性、跨操作系统消息传输以及大规模多公司经济模拟,构建了高度真实且多样化的交互场景。每个轨迹包含密集的输入事件序列、节点对齐信息以及因果模拟器状态,使得细粒度的行为分析成为可能。此次发布版本包含36条轨迹、980帧图像与6个模拟公司,覆盖浏览器操作系统、macOS与Windows三种环境。
使用方法
使用者可通过加载data.jsonl文件获取每条轨迹的完整元数据与结构化信息,包括轨迹标识符、角色信息、环境类型、目标描述与节点树结构。为进行可视化分析,可访问screenshots/<trajectory>/<node_id>.png获取终端节点对应帧,或通过videos/<trajectory>.webm播放完整屏幕录制。基于轨迹中提供的input_events与observations字段,研究者可复现操作过程并分析因果状态变迁,适用于GUI智能体训练、行为建模以及多应用交互场景的实证研究。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim)数据集由SynthUX研究团队于近期创建,旨在应对图形用户界面(GUI)代理在真实多应用环境中的视觉计算机操作轨迹生成难题。该数据集聚焦于模拟企业内部的多角色协作场景,通过生成包含终端、代码编辑器、浏览器、邮件及办公套件等多应用交互的低层级鼠标键盘操作轨迹,为GUI代理研究提供了大规模、细粒度的视觉-动作对齐数据。作为首个以经济模拟为背景的多公司、多操作系统数据集,它通过自然语言目标分解为动作节点树,并记录完整的屏幕视频与逐帧状态,显著推动了计算机使用领域从单应用到跨应用、从模拟到真实场景的范式转变,为开发具备复杂任务规划与执行能力的GUI智能体奠定了数据基础。
当前挑战
该数据集面临的核心挑战在于多应用协同操作的真实性模拟与大规模构建效率的平衡。在领域问题层面,传统GUI代理数据集多局限于单一应用或简化环境,忽略了真实工作流中跨应用数据传递(如从邮件提取信息填入表单)、并发任务管理(如同时使用浏览器和终端)以及操作系统差异(macOS vs Windows)带来的视觉与交互歧义,而SynthUX需在模拟环境中精准复现这种复杂性。在构建过程中,关键挑战包括:如何通过低层级输入事件(如鼠标坐标与键盘敲击)而非高层API调用保持轨迹的因果一致性;如何为每个经济角色(如工程师、产品经理)生成差异化的目标与行为模式以避免数据同质化;以及如何在有限的计算资源下(本版本仅36条轨迹)合成足够鲁棒的跨应用交互以支持模型泛化。
常用场景
经典使用场景
SynthUX Economy R3 W023 数据集在计算机使用智能体研究领域占据着举足轻重的地位,其最为经典的应用场景是作为多应用、跨平台GUI智能体训练与评估的基准测试平台。该数据集通过模拟真实企业环境中不同角色的设备操作轨迹,涵盖了终端、笔记、代码编辑器、浏览器、即时通讯、邮件及办公套件等多种应用程序的协作使用。研究者可以利用其中的36条精细录制轨迹,结合底层鼠标键盘事件序列与屏幕录像,训练能够理解复杂自然语言目标并自主完成跨应用操作的高阶智能体。这种基于原生多应用执行环境的数据设计,为探索智能体在真实桌面环境下的通用计算机操作能力提供了至关重要的数据支撑。
实际应用
在实际工业场景中,SynthUX数据集的影响力已延伸至自动化办公助手、企业流程自动化以及智能软件测试等多个前沿领域。例如,企业可以基于该数据集中丰富的多应用操作模式,训练能够自动完成报销审批、跨系统数据迁移或会议纪要整理等复杂任务的数字员工。在软件质量保障方面,开发者利用数据集中的低层级操作事件来模拟真实用户行为,从而更加精准地发现跨应用交互过程中的潜在缺陷。此外,该数据集还为构建具备跨平台迁移能力的通用GUI智能体提供了训练素材,使得同一套模型能够适应macOS、Windows及浏览器环境下的操作差异,这对于推动下一代人机交互界面的智能化演进具有重要的实践价值。
衍生相关工作
围绕SynthUX Economy R3 W023数据集,学术界已经衍生出一系列富有影响力的经典工作。最突出的方向包括:基于层级规划的多应用任务分解方法,研究者利用数据集中天然的节点树结构,开发出能够将复杂自然语言指令自动拆解为子目标序列并逐层执行的规划器;其次,因果干预推理模型成为研究热点,学者们借鉴数据集中严格的低层级输入与观察状态的对应关系,构建了能够进行反事实推理的智能体框架,从而显著提升了模型在未见情景下的泛化性能。此外,跨模态表示学习也受益于此,多项工作尝试联合利用屏幕录像与操作事件序列学习更加紧凑的行为表征,为后续的少样本学习和迁移学习奠定了坚实的算法基础。这些衍生研究共同推动着计算机使用智能体领域向着更加通用、更加智能的方向持续突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务