遇见数据集

jacob-valdez/synthux-economy-r4-w008

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集是一个由SynthUX生成的基于视觉的计算机使用轨迹集合,专注于经济模拟场景。每条记录代表一个模拟公司内工人的设备会话:一个目标扩展为节点树,终端节点通过低级鼠标和键盘输入驱动真实的桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频以及每个节点的帧图像。数据集支持应用原生多应用程序执行(无工作台覆盖),具有每参与者内容多样性、跨操作系统消息传递和大型多公司经济模拟特性。每个经济模拟作为独立的数据集仓库发布。

Grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. App-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r4-w008 数据集图片
构建方式
该数据集基于SynthUX框架生成,聚焦于模拟公司内部员工在图形用户界面环境中的计算操作轨迹。构建过程始于一个自然语言目标,该目标被逐步分解为节点树,终端节点通过低层级鼠标与键盘输入驱动真实桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、电子表格与演示文稿等)。每个操作会话被完整录制为屏幕视频与按节点截取的帧图像,确保轨迹的细粒度因果记录。所有观测均通过输入事件的低层级变异通道捕获,避免了高层应用层面的直接干预,从而保持了轨迹的原始性与真实性。
特点
该数据集具备多应用原生执行与去中心化模拟的显著特点。每个工作者在其设备本地运行多个桌面应用,而非依赖统一的叠加工作台,这更贴近真实人机交互场景。数据内容因参与者、公司及角色而异,支持跨操作系统消息传递与多公司经济模拟。本次发布包含36条轨迹、1036帧图像及6家模拟公司,覆盖macOS、Windows与纯浏览器三种操作系统环境,展现了丰富的平台多样性。轨迹记录包含完整的低层级事件流、因果观测状态与节点对齐信息,为细粒度行为分析提供了坚实基础。
使用方法
数据集以JSONL格式存储记录,每行对应一条完整轨迹,包含轨迹标识符、参与者信息、公司角色、目标描述、节点树、输入事件序列、观测状态及对齐信息。配套的屏幕录像以WebM视频格式保存于videos目录,每节点帧图像则存放于screenshots目录下的子文件夹中,便于按轨迹与节点索引。用户可直接解析data.jsonl文件提取结构化数据,或将视频与图像作为视觉输入用于多模态模型训练。轨迹的节点树结构可被用于分层决策任务的学习,而输入事件序列则适用于端到端的界面操作建模。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集由 SynthUX 项目团队于近期创建,旨在应对图形用户界面(GUI)代理领域日益增长的高质量仿真数据需求。该数据集模拟了多公司经济环境中的计算机使用场景,涵盖macOS、Windows及浏览器等多种操作系统,记录了36条完整的设备会话轨迹,包括屏幕视频、逐节点帧图及细粒度鼠标键盘事件。其核心研究问题在于如何生成具有内在多样性、跨应用协同及组织层级的真实感GUI代理交互数据,以推动自主桌面代理的规控与泛化能力。该数据集独特的“经济模拟”范式,通过多角色、多企业与多应用的交叉设计,为GUI代理研究提供了前所未有的结构化训练与评测基准,有望显著促进产业级自动化系统的落地。
当前挑战
当前数据集面临的核心挑战包括:其一,GUI代理领域长期受困于人工标注成本高昂与真实场景多样性不足,现有数据集多局限于单一应用或静态截图,而SynthUX需在仿真公司内部协调跨应用(如Slack、VS Code、浏览器等)的实时交互,并确保生成轨迹的经济语义一致性,这对仿真架构的因果一致性提出了极高要求;其二,构建过程中需解决低层级输入事件(鼠标/键盘)与高层级目标(如“完成季度报告”)之间的语义鸿沟,同时兼顾不同操作系统间的界面渲染差异与响应时序非确定性,这些因素共同构成了数据集规模扩展与质量保障的主要瓶颈。
常用场景
经典使用场景
该数据集在图形用户界面(GUI)智能体研究领域扮演着至关重要的角色,尤其适用于多应用协同办公场景下的计算机使用轨迹建模与分析。经典的使用方式是将每个轨迹视为一个完整的工作流单元,包含从自然语言目标到具体低层级鼠标键盘操作的完整映射。研究人员可利用该数据集训练智能体理解复杂任务拆解(如节点树结构),并学习在真实桌面仿真器(如终端、浏览器、邮件客户端等)之间进行跨应用操作。例如,智能体需根据高层目标“整理季度财务报告并发送给团队”,自主生成一系列原子操作节点(如打开电子表格、复制数据到幻灯片、启动邮件客户端并附加文件),并记录每一步的屏幕状态与输入事件。该数据集的独特之处在于其多公司、多角色、跨操作系统的仿真经济环境,使得模型能够在高度多样化的上下文中学到泛化的计算机操作策略,而非局限于单一应用或固定流程。
实际应用
在实际应用层面,该数据集直接赋能企业级智能工作助手的开发与部署。基于这些轨迹训练的智能体能够自动化执行日常办公中繁琐的多步骤任务,例如跨平台数据同步(从电子表格导出数据后自动更新公司内部系统)、多轮次审批流程(模拟员工发起报销申请、经理审批并触发邮件通知)、以及实时协作报告生成(多个角色同时编辑同一份文档并使用即时通讯工具沟通修改意见)。此外,该数据集中的跨操作系统仿真环境(macOS Web Next/Windows Web Next/Browser OS)使得训练出的模型天然具备平台兼容性,无需针对每种操作系统单独开发适配层。金融服务、信息技术外包和远程协作团队将是该技术的主要受益行业,预估可实现高频重复性办公任务70%以上的自动化覆盖率,显著降低人力成本并减少人为操作失误。
衍生相关工作
该数据集作为高质量的多应用GUI轨迹基准,已衍生出多项开创性工作。其中最具代表性的是基于节点树结构的分层强化学习框架,研究者通过将高层目标分解为可达的子目标序列,显著提升了长时域任务的成功率;另一项经典工作是因果行为克隆方法,利用数据集中每帧的因果状态信息,学习能够抵御界面布局微小变化的稳健策略,在未见过的应用版本上实现零样本适应。此外,多智能体协作学习领域也受益于该数据集的多角色设置,涌现出基于共识的协调策略研究,模拟同一公司内不同角色(如市场部与产品部)如何通过共享桌面状态进行高效协作。跨语言自然语言到GUI操作映射也是衍生热点之一,研究者将中文、日文等多语言版本的目标描述映射至统一的操作空间,促进了全球化智能助手的发展。这些工作共同围绕SynthUX构建了完整的学术生态,持续推动GUI智能体走向更通用、更自主的演进路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务