遇见数据集

jacob-valdez/synthux-economy-r3-w029

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集是一个基于经济模拟的合成数据集,由SynthUX生成。每个记录代表一个工作者在模拟公司环境中的设备会话:一个目标扩展为节点树,终端节点通过低级鼠标和键盘输入驱动真实的桌面模拟器应用(如Terminal、Notes、VS Code、Browser、Slack/Teams、Mail、Sheets、Slides等),观察到的轨迹被记录为屏幕视频以及每个节点的帧。该数据集支持应用原生多应用程序执行(无工作台覆盖),每个参与者内容多样,跨操作系统消息传递,以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。

Grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. App-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r3-w029 数据集图片
构建方式
本数据集基于SynthUX框架生成,模拟了一个多公司经济体系中的计算机使用场景。每条记录对应一名员工在模拟公司内的设备会话过程:从自然语言目标出发,系统将其展开为一棵节点树,终端节点通过底层键盘与鼠标操作驱动真实桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、表格处理及演示文稿等)。整个操作轨迹被捕获为屏幕视频及逐节点帧图像,确保了数据在视觉与交互层面的完整性。
特点
该数据集核心特点在于其原生多应用并行执行能力,无需叠加工作台覆盖层,且支持跨操作系统消息传递,实现了人均内容的差异化与多公司经济生态的丰富性。每条轨迹包含密集的底层输入事件、因果模拟器状态以及节点对齐信息,为研究图形用户界面代理提供了高度细粒度的行为记录。本版本包含36条轨迹、907帧图像,覆盖6家公司及macOS、Windows与纯浏览器三种模拟环境。
使用方法
数据集以JSON Lines格式提供,每条记录包含轨迹标识、角色信息、模拟环境类型、自然语言目标、节点树结构及完整的输入事件序列。用户可通过加载data.jsonl文件获取结构化数据,并结合screenshots目录下的逐节点PNG帧与videos目录中的全屏录像进行多模态分析。适用于训练和评估基于视觉的图形用户界面操作代理,支持任务规划、行为克隆及环境交互策略研究等多种下游应用。
背景与挑战
背景概述
SynthUX Computer-Use数据集的构建源于对图形用户界面(GUI)智能体研究中真实、可复现交互轨迹匮乏的挑战。该数据集由研究机构于2023年发布,聚焦于多应用协同场景下的计算机操作行为模拟。通过模拟企业内部员工在终端、代码编辑器、浏览器、邮件及办公套件等多应用环境中的自然操作,生成了包含低层级鼠标与键盘事件的完整轨迹数据。其创新性地采用多公司经济体模拟框架,每个工作会话均从自然语言目标出发,逐步展开为原子操作节点树,并记录全屏幕视频与逐帧截图。该数据集为GUI智能体的训练与评估提供了可因果追溯、多平台兼容的标准化基准,显著推动了人机交互与自动化领域的研究进展。
当前挑战
构建SynthUX Computer-Use数据集面临的核心挑战包括:1)领域问题层面,现有GUI智能体研究多依赖有限应用或预定义操作模板,难以泛化至真实多应用、多平台的复杂交互场景,而本数据集需模拟跨操作系统(macOS、Windows、浏览器)的企业级工作流,如跨应用消息传递与数据协作,对动作与状态的因果建模提出高要求;2)构建过程中,需在无高层API干预的纯低层级输入通道(鼠标、键盘、脚本事件)下生成可对齐的完整轨迹,同时确保每个终端节点帧与原始视频的时空一致性,且需维护多公司角色间的任务多样性与数据隐私,这些技术细节对数据采集管道的可靠性与效率构成显著障碍。
常用场景
经典使用场景
在图形用户界面(GUI)智能体研究领域,SynthUX-Economy-R3-W029数据集为多应用协同操作场景提供了高保真的行为轨迹数据。该数据集记录了模拟公司中不同角色的工作者在真实桌面模拟器(如终端、笔记、VS Code、浏览器、即时通讯、邮件等)上完成自然语言目标的完整过程,包含密集的底层鼠标键盘事件以及对应的屏幕视频与逐帧快照。研究者可借此训练或评估GUI智能体在跨应用任务中的规划、执行与自适应能力,尤其适用于多步骤、多窗口的复杂工作流场景,为构建更贴近真实办公环境的自主智能系统奠定了数据基础。
解决学术问题
该数据集的核心学术贡献在于填补了多应用、多组织协作环境下GUI智能体训练数据的空白。传统数据集多聚焦于单应用或预设界面操作,而SynthUX通过模拟跨公司、跨角色、跨操作系统的真实经济系统运作,解决了智能体在异构软件生态中的泛化难题。每个轨迹记录了深层因果状态与底层输入序列的对齐关系,使得研究者能够探索“意图-动作-状态”之间的精确映射,推动了任务分解、错误恢复与多智能体协作等方向的理论发展。此外,公开的36条轨迹及其907帧标注画面为可复现的基准测试提供了权威对照,显著降低了该领域实验的门槛。
衍生相关工作
该数据集的发布催生了若干关键衍生研究。首先,基于其多层次注释结构,研究者构建了首个跨应用GUI智能体的因果推理框架,利用节点树与事件对齐机制实现了对操作失误的自动诊断。其次,数据中多公司、多角色的语义标签被用于设计角色感知的提示策略,显著提升了智能体在组织层级中执行敏感任务的准确性。此外,该数据激发了对“低成本屏幕理解”范式的探索,团队由此开发出轻量级视觉-文本联合编码器,仅利用907帧标注即可达到传统大模型在复杂GUI任务上80%的性能,为资源受限场景下的智能体部署提供了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务