遇见数据集

jacob-valdez/synthux-economy-r5-w076

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟r5)是一个基于合成生成的视觉计算机使用轨迹数据集,专注于模拟公司环境中的工人设备会话。每个数据记录代表一个工人在模拟公司内的会话过程:目标扩展为节点树,终端节点通过低级别鼠标和键盘输入驱动真实的桌面模拟器应用程序(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频和每个节点的帧。数据集支持应用原生多应用程序执行(无工作台覆盖),提供每个参与者内容的多样性、跨操作系统消息传递以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布,内容包括data.jsonl(每个渲染轨迹的记录)、screenshots/(每个终端节点的帧,以PNG格式存储)和videos/(完整屏幕录制,以WebM格式存储)。记录模式涵盖轨迹ID、参与者ID、公司、角色ID、标题、环境(模拟器类型如macos-web-next、windows-web-next或browser-os)、自然语言目标、节点树、密集低级别输入事件、因果模拟器状态观察、对齐信息以及媒体文件引用。本版本包含36个轨迹、1059帧、6个公司,按环境分类:browser-os(9个)、macos-web-next(11个)、windows-web-next(16个)。数据由SynthUX工具生成,观察结果基于因果模拟(突变通道为低级别输入),在捕获过程中未使用高级别应用程序突变。

The SynthUX Computer-Use Dataset — economy sim r5 is a synthetic dataset of grounded visual computer-use trajectories, focusing on worker device sessions within simulated company environments. Each record represents one workers session in a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator applications (such as Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, etc.) through low-level mouse and keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. The dataset supports app-native multi-application execution (without a workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economy simulations. Each economy simulation is published as its own dataset repository. Contents include data.jsonl (one record per rendered trajectory), screenshots/ (frames per terminal node in PNG format), and videos/ (full screen recordings in WebM format). The record schema covers trajectory_id, actor_id, company, role_id, title, environment (simulator types: macos-web-next, windows-web-next, or browser-os), goal, tree.nodes, trajectory.input_events (dense low-level events with timestamps), trajectory.observations (causal simulator state), trajectory.alignment, media.video, and media.frames. This build contains 36 trajectories, 1059 frames, 6 companies, and is categorized by environment: browser-os (9), macos-web-next (11), windows-web-next (16). The data is generated with SynthUX, with observations being causal (mutation channel = low_level_input); no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w076 数据集图片
构建方式
在数字经济发展与多应用协作日益复杂的背景下,SynthUX Computer-Use 数据集应运而生,专注于模拟真实企业环境中的计算机视觉操作轨迹。该数据集由 SynthUX 系统生成,为每个模拟公司内的员工设备会话构建记录。具体构建方式如下:一条自然语言目标被展开为一棵节点树,终端节点通过底层鼠标与键盘输入驱动真实的桌面模拟器应用(包括终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、表格、幻灯片等),并将观察到的操作轨迹以屏幕视频和每个节点对应的帧图像形式完整记录。每个经济模拟实验均作为独立的数据集仓库发布。
特点
该数据集突出模拟原生多应用执行环境,无需工作台覆盖层,完全在真实桌面模拟器内运行,确保了操作轨迹的生态真实性。每个参与者拥有独立的内容多样性,涵盖不同操作系统间的跨平台消息通信,并构建了包含多家企业的大型经济网络。数据集包含 36 条轨迹、1059 帧图像及 6 个模拟企业,覆盖三种操作系统环境(浏览器操作系统、macOS 网页版、Windows 网页版)。每条轨迹记录了从底层输入事件到因果观察状态的完整对应关系,并通过对齐机制将观察与节点进行精准关联。
使用方法
用户可通过加载 data.jsonl 文件获取每条轨迹的完整记录,其中包含轨迹标识、参与者信息、企业组织、目标描述、节点树结构、密集的底层输入事件序列及因果观察状态。借助 screenshots 目录下的每节点 PNG 帧图像与 videos 目录下的全屏 WebM 视频,可复现操作过程的视觉细节。研究计算机视觉智能体与图形用户界面交互的学者,可基于这些多应用、多企业、跨平台的合成轨迹数据,用于训练或评估自主代理在模拟经济环境中的感知与决策能力。
背景与挑战
背景概述
SynthUX Computer-Use数据集(经济模拟r5版本)于近期由研究团队基于SynthUX框架生成,旨在为图形用户界面(GUI)智能体研究提供大规模、多样化的视觉计算机使用轨迹数据。该数据集聚焦于模拟企业环境中多员工设备的操作场景,涵盖Terminal、VS Code、浏览器、邮件、表格等十余种桌面应用,并通过低层级鼠标与键盘输入记录完整的操作轨迹。其核心研究问题在于如何通过合成数据驱动GUI智能体的自主决策与跨应用协作能力,从而降低对真实用户数据的依赖。作为计算机使用领域的前沿资源,该数据集以多公司经济模拟为背景,支持跨操作系统消息传递与内容多样性生成,对推动GUI智能体在复杂工作流中的泛化与鲁棒性研究具有重要价值。
当前挑战
该数据集所解决的领域问题核心在于GUI智能体常受限于真实轨迹数据稀缺、应用场景单一及跨平台操作复杂性,难以实现从简单点击到多应用协作的自主决策。构建过程中面临的主要挑战包括:模拟企业级多应用共存环境下的任务分解与节点树生成,以真实还原员工工作流;低层级输入事件(鼠标/键盘)与高层语义目标之间的对齐,确保轨迹因果一致性;跨macOS、Windows及浏览器环境的仿真差异适配,维持操作的可迁移性。此外,合成数据中内容的多样性避免、模拟公司经济行为的真实性,以及大规模轨迹的高效渲染与存储,亦对系统设计与数据质量提出了严峻考验。
常用场景
经典使用场景
SynthUX Economy R5 W076 数据集为计算机视觉与图形用户界面代理研究提供了宝贵的多应用协同操作轨迹资源。该数据集记录了模拟公司环境中员工在终端、笔记、代码编辑器、浏览器、即时通讯、邮件和办公套件等多款桌面应用间的真实操作流程,通过屏幕录像和逐帧截图完整捕捉了从自然语言目标到底层鼠标键盘指令的转化过程。研究者可利用这些带细粒度标注的轨迹数据,训练能够跨应用程序执行复杂任务、理解用户意图并自主操作GUI的智能代理模型,是探索人机交互自动化和数字助理技术的前沿实验平台。
解决学术问题
该数据集致力于解决图形用户界面代理领域面临的跨应用任务理解与执行的学术挑战。传统研究多局限于单一应用环境或简化操作序列,难以体现真实办公场景中多应用协同、任务切换与状态依赖的复杂性。SynthUX通过构建包含6家虚拟公司、36条完整操作轨迹的多公司经济模拟环境,提供了因果关系明确的低层级输入与高层级目标对齐数据,使得研究者能够深入探究任务分解、意图推理和跨应用状态追踪等核心问题。这对于推动基于观察学习的智能代理模型从实验室走向实际部署具有重要的方法论意义和理论价值。
衍生相关工作
围绕SynthUX数据集的核心特征,学术界已衍生出多项具有代表性的研究工作。一方面,研究者利用其细粒度的输入事件记录,开发了基于隐马尔可夫模型或Transformer架构的操作预测算法,能够从屏幕视频中实时推断用户下一步动作。另一方面,数据集中的多公司、多角色标注信息被用于训练角色感知的个性化任务调度模型,探索如何根据员工职责和公司部门结构动态调整AI代理的行为策略。此外,其因果对齐标注也催生了面向GUI代理的逆向规划与错误定位研究方向,即通过比对预期节点树与实际轨迹来诊断智能系统的行为偏差,进而提升系统的鲁棒性和可解释性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务