遇见数据集

jacob-valdez/synthux-economy-r5-w000

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集—经济模拟r5是一个由SynthUX生成的基于视觉的计算机使用轨迹数据集。每个记录代表一个工人在模拟公司中的设备会话:目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频以及每个节点的帧。该数据集支持应用原生多应用程序执行(无工作台覆盖)、每个参与者内容多样性、跨操作系统消息传递和大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。

The SynthUX Computer-Use Dataset — economy sim r5 is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record represents one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (such as Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, etc.) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r5-w000 数据集图片
构建方式
SynthUX-Economy-R5-W000数据集源自SynthUX框架,旨在通过大规模多公司经济模拟生成具有实际意义的图形用户界面操作轨迹。构建过程以模拟公司内一名员工的设备会话为基本单元:首先将自然语言目标分解为节点树,终端节点驱动桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、即时通讯、邮件、电子表格、演示文稿等)执行底层鼠标与键盘输入。整个操作轨迹以屏幕视频及每终端节点对应帧的形式被完整记录。每个经济模拟作为独立的数据集仓库发布,本版本包含6家模拟公司的36条操作轨迹。
特点
该数据集的核心特点在于其实践导向的多应用原生执行模式,摒弃了传统的工作台覆盖层,实现了应用间无隔阂的交互模拟。跨操作系统信息传递的机制使得不同环境(macOS、Windows、浏览器)下的操作行为各具特色。每个执行者的内容具有高度多样性,且操作过程中观察到的状态变化是因果驱动的,仅通过低层级输入控制,杜绝了高层级应用干预,从而保证了轨迹的真实性与可溯源性。数据集包含36段视频与832帧图像,为细粒度行为分析提供了丰富素材。
使用方法
数据集以标准格式存储,主文件data.jsonl包含每条轨迹的元数据与事件序列,其中字段涵盖执行者身份、所属公司、角色、环境类型、自然语言目标、节点树结构、密集型底层输入事件(含毫秒级时间戳)、因果模拟状态及观察结果与节点间的对齐映射。媒体资源方面,screenshots目录存放每终端节点对应的PNG帧图像,videos目录提供全屏录制的WebM格式视频。用户可按轨迹ID索引数据,结合对齐信息研究操作行为与系统状态变化之间的关联,适用于GUI代理模型训练、行为建模与因果推理等研究场景。
背景与挑战
背景概述
SynthUX Computer-Use Economy Simulator数据集(synthux-economy-r5-w000)由SynthUX团队于近年开发,旨在推动图形用户界面(GUI)代理在复杂多应用场景中的计算机使用能力研究。该数据集通过模拟多公司经济体系,构建了包含36条轨迹、832帧图像的视觉轨迹库,每条轨迹记录了员工在桌面模拟器(如终端、浏览器、邮件等)中的完整操作过程,从自然语言目标到低层级鼠标/键盘输入事件。其核心研究问题在于如何生成具备跨操作系统消息传递、多应用协同及多公司经济规模效应的可视化计算机使用轨迹,为GUI自主代理的训练与评估提供可复现的基准。该数据集采用Apache-2.0许可证公开,填补了现有数据集在多应用经济模拟场景下的空白,对自动化办公、人机交互及智能代理研究具有重要推动作用。
当前挑战
数据集面临的核心挑战包括:首先,在领域问题层面,现有的GUI代理训练数据多局限于单应用或封闭环境,难以应对真实世界中多应用协同(如跨软件消息传递、多公司经济交互)的复杂性与动态性,SynthUX需通过模拟六家公司、多种角色与操作系统环境,覆盖浏览器、macOS和Windows等异构平台,确保轨迹的泛化能力。其次,在数据集构建过程中,如何将高层自然语言目标精确分解为低层级输入事件节点树,并保证因果观测的纯净性(仅依赖低层级输入突变,避免高层应用干预)是技术难点;同时,每帧图像需严格对应终端节点最后输入事件的时间戳,以维持时间一致性。此外,生成轨迹的经济模拟规模(多公司、多角色、跨OS)显著增加了数据标注与质量控制的成本,需在轨迹多样性(36条)与数据保真度之间取得平衡。
常用场景
经典使用场景
SynthUX Computer-Use数据集(economy sim r5)专为研究多公司模拟环境下的计算机使用行为而设计。其经典的使用场景是训练和评估GUI智能体(GUI agents)在复杂、跨应用的真实桌面操作任务中的表现。研究人员可基于该数据集中的屏幕录像、逐帧截图以及细粒度的鼠标/键盘输入事件,构建能够理解自然语言目标并自主执行多步骤操作的智能系统,例如让一个智能体在模拟公司中跨终端、浏览器、邮件和即时通讯工具完成协作任务。该场景的核心价值在于提供了丰富的视觉和低层交互数据,支持端到端的视觉语言模型训练,从而弥合高层指令与底层界面操作之间的鸿沟。
解决学术问题
该数据集旨在解决学术领域中关于多应用、多实体环境下计算机使用行为建模的若干关键问题。首先,它克服了现有数据集往往局限于单一应用或孤立任务的局限,通过模拟包含6家公司、36条轨迹的多公司经济体系,为研究跨组织协作与信息流动提供了基础。其次,数据集中因果关系的保留(仅通过低层输入驱动状态变化)使研究人员能够探索可解释的行为分解,例如将高层目标拆解为具体的节点树和终端操作。这一设计对于理解智能体如何从复杂目标中自主推导步骤序列具有重要意义,推动了从被动记录到主动规划的研究范式转变。
衍生相关工作
基于SynthUX数据集,学术界和工业界已衍生出多项经典工作。在模型层面,研究者开发了能够从屏幕录像中理解任务进展的视觉编码器,将低层事件序列转化为可复用的技能模块。在方法论上,有人提出了基于节点树对齐的行为克隆技术,利用数据集中轨迹与目标的结构化映射关系,显著提升了智能体在未知任务上的泛化能力。此外,该数据集的模拟环境设计催生了若干关于多智能体协作经济模拟的研究,例如如何让多个智能体在不同公司角色中协同完成供应链管理任务。这些衍生工作共同推动了GUI自动化领域从规则脚本向数据驱动推理的转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务