遇见数据集

jacob-valdez/synthux-economy-r4-w004

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟版本r4)是一个合成数据集,包含由SynthUX生成的基于视觉的计算机使用轨迹。每个记录代表一个模拟公司内的工作者设备会话:一个目标扩展为节点树,终端节点通过低级别鼠标/键盘输入驱动真实桌面模拟器应用程序(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、Sheets、Slides等),观察到的轨迹被记录为屏幕视频以及每个节点的帧。数据集支持应用原生多应用程序执行(无工作台覆盖),具有每个参与者内容多样性、跨操作系统消息传递和大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。内容包含:data.jsonl(每个渲染轨迹一条记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点在最后输入事件时的帧)和videos/<trajectory>.webm(完整屏幕录制)。记录模式包括轨迹ID、参与者ID、公司、角色、标题、环境(模拟器类型)、目标(自然语言目标)、节点树、输入事件、观察结果、对齐信息以及媒体文件(视频和帧)。统计显示本版本包含36个轨迹、1008帧、6家公司,环境分布为browser-os(16个)、macos-web-next(9个)和windows-web-next(11个)。数据生成使用SynthUX工具,观察结果是因果性的(突变通道为低级别输入),捕获过程中未使用高级别应用程序突变。

Grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. App-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r4-w004 数据集图片
构建方式
本数据集基于SynthUX框架构建,通过模拟多公司经济环境,生成基于计算机界面的智能体操作轨迹。每条记录对应一名员工在模拟公司中的设备会话,其核心构建流程为:将自然语言目标扩展为节点树,终端节点通过低层级鼠标与键盘输入驱动桌面模拟器应用(如终端、笔记、VS Code、浏览器、即时通讯、邮件、表格与演示文稿等),从而记录完整的桌面操作轨迹。整个生成过程遵循因果观测原则,仅依赖低层级输入信号进行状态变更,不采用高层级应用篡改手段,确保了数据的真实性与可复现性。每个经济仿真版本均作为独立数据集仓库发布,形成了多公司、多角色、跨操作系统的结构化数据体系。
特点
该数据集具备显著的多维度多样性特征。从内容层面看,实现了面向不同角色的个性化内容生成,避免了单一模板化的交互记录。从应用层面看,支持原生的多应用并行操作执行,摒弃了传统的工单叠加模式,使得每个轨迹都真实反映了跨应用协作的复杂场景。此外,数据集涵盖了macOS、Windows及纯浏览器三种操作系统环境的操作日志,并构建了包含6家模拟公司、36条完整轨迹、1008帧关键帧的大规模样本库。每条轨迹均包含密集的低层级输入事件序列、因果模拟器状态快照以及节点对齐信息,为计算机使用行为的深层分析提供了丰富而可靠的数据支撑。
使用方法
用户可通过HuggingFace数据集加载库直接使用本数据集,其核心数据存储于`data.jsonl`文件中,每条记录包含轨迹ID、所属公司、角色信息、目标描述、节点树结构以及完整的输入事件序列。辅助资源包括`videos`目录下的全屏操作录像(webm格式)与`screenshots`目录中按轨迹和节点组织的关键帧图像。研究人员可依据`trajectory.alignment`字段建立观测状态、输入事件与节点ID之间的映射关系,适用于智能体行为建模、多步推理任务以及人机交互模式分析等场景。推荐结合模拟器环境进行轨迹复现与验证,以深入挖掘其中的因果关联与行为规律。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim)数据集诞生于2024年,由SynthUX团队在多公司经济模拟框架下构建,旨在解决图形用户界面(GUI)智能体在复杂多应用场景中的轨迹理解与自动化问题。该数据集聚焦于模拟企业内部员工的桌面操作,涵盖跨操作系统(macOS、Windows)、多应用协同(终端、代码编辑器、浏览器、邮件、即时通讯等)的端到端计算机操作轨迹。通过将自然语言目标拆解为动作节点树,并记录低层级鼠标键盘事件与屏幕视频,它支持对GUI智能体决策过程的可解释性研究。该数据集的发布填补了经济仿真背景下多公司、多角色、多应用跨平台操作的标注数据空白,为后续GUI智能体训练与评估提供了重要基准,尤其在工业级自动化与数字员工模拟领域具有深远影响。
当前挑战
该数据集解决的核心领域问题在于:GUI智能体需要从高维视觉屏幕状态中精准理解当前语义,并生成跨应用、跨操作系统的低层控制指令,这一过程面临状态空间稀疏、动作序列长依赖以及环境反馈延迟等挑战。构建过程中,团队面临多公司经济仿真中角色内容多样性与操作一致性的平衡难题,需确保不同actor(如员工、经理)在动态模拟中的行为符合真实企业逻辑。此外,数据集捕获需在未使用高级应用突变的情况下,通过因果观测通道同步低层输入与屏幕视频,这要求严格的时序对齐与状态隔离,以避免干扰模拟的生态效度。最终,跨操作系统(macOS、Windows、浏览器OS)的异构环境进一步增加了轨迹标准化与帧标注的复杂度。
常用场景
经典使用场景
在智能体与图形用户界面交互的研究领域,SynthUX Economy模拟数据集为多应用协同的计算机使用行为提供了高保真度的观测基准。该数据集精心构建了跨平台的桌面模拟环境,囊括终端、代码编辑器、浏览器、即时通讯及办公套件等真实应用程序,完整记录了工人在模拟企业中的设备会话轨迹。其经典应用场景在于训练和评估能够理解复杂图形界面并执行多步骤任务的视觉语言模型,例如要求模型根据自然语言目标自主完成跨应用的信息检索、文档编辑与消息发送等操作序列。
衍生相关工作
SynthUX Economy数据集的出现催生了一系列关于GUI智能体泛化能力与多步推理深度的前沿研究。基于其丰富的轨迹结构与因果标注,衍生工作主要围绕层次化任务分解与动态规划展开,例如利用节点树结构指导智能体学习从高层目标到底层动作的映射关系。此外,该数据集推动了跨平台迁移学习的研究,研究者利用其多操作系统环境的数据,探索视觉编码器与动作策略在macOS、Windows及浏览器OS间的泛化边界。在评估方法论层面,以该数据集为基准,诞生了更注重过程正确性而非仅结果正确性的新型评价指标,为构建更可靠、可解释的数字智能体铺平了道路。
数据集最近研究
最新研究方向
SynthUX-economy-r4-w004数据集聚焦于多代理经济仿真与图形用户界面(GUI)智能体的合成轨迹生成,代表了计算机使用自动化领域的前沿探索。该数据集通过模拟多公司经济体系下的真实桌面操作场景,记录了包含终端、笔记、代码编辑器及跨平台通讯工具在内的多应用协同工作流,为研究复杂人机交互环境中的任务分解与视觉推理提供了结构化训练基础。其核心创新在于将高层目标自动扩展为可执行的节点树,并通过低层级鼠标键盘事件驱动仿真器,生成带对齐信息的屏幕视频与帧级标注,显著提升了GUI智能体在异构操作系统(macOS、Windows、浏览器)上的泛化能力。这一成果与近期AI代理在自动化办公、软件测试及流程编排等热点应用紧密相关,为构建可跨应用执行复杂经济任务的自主智能体奠定了数据基石,推动了大模型从静态文本理解向动态环境操作的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务