遇见数据集

jacob-valdez/synthux-economy-r2-w023

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集 — 经济模拟r2 是一个由SynthUX生成的视觉计算机使用轨迹数据集,专注于模拟公司环境中的工人设备会话。每个记录代表一个完整的轨迹,其中自然语言目标扩展为节点树,终端节点通过低级别鼠标和键盘输入驱动真实桌面模拟器应用(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察轨迹被记录为屏幕视频和每节点帧。数据集支持原生多应用执行(无工作台覆盖),具有每个参与者的内容多样性、跨操作系统消息传递和大规模多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。数据集包含data.jsonl文件(每个渲染轨迹一个记录)、屏幕截图(每轨迹每节点帧)和视频(全屏录制)。统计显示有36个轨迹、923个帧、6个公司,按模拟环境分布:browser-os(10)、macos-web-next(19)、windows-web-next(7)。数据由SynthUX生成,观察基于因果模拟器状态。

The SynthUX Computer-Use Dataset — economy sim r2 is a grounded visual computer-use trajectories dataset generated by SynthUX. Each record represents one workers device session inside a simulated company: a natural-language goal expands into a node tree, terminal nodes drive real desktop-simulator applications (e.g., Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides) through low-level mouse and keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution without a workbench overlay, per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repository. The dataset includes data.jsonl (one record per rendered trajectory), screenshots (per-node frames for each trajectory), and videos (full screen recordings). Statistics for this build: 36 trajectories, 923 frames, 6 companies, distributed by environment: browser-os (10), macos-web-next (19), windows-web-next (7). Generated with SynthUX, observations are causal with mutation channel as low-level input.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r2-w023 数据集图片
构建方式
该数据集名为SynthUX Computer-Use (economy sim),由SynthUX框架生成,专注于模拟企业环境中多应用程序的图形用户界面操作轨迹。构建过程以模拟公司内员工的设备会话为基础:每个自然语言目标被分解为节点树,终端节点通过低层级的鼠标与键盘输入驱动真实桌面模拟器应用(如终端、记事本、VS Code、浏览器、即时通讯工具、邮件、表格、幻灯片等),并将观察到的操作轨迹记录为屏幕视频及每个节点对应的帧图像。每个经济模拟版本作为独立的数据集仓库发布。
特点
数据集的核心特点在于其原生多应用程序执行能力,无需工作台覆盖层,且支持跨操作系统消息通信与大型多公司经济模拟。记录包含每一条轨迹的唯一标识符、演员身份、公司归属、角色及环境类型(macOS、Windows或浏览器操作系统)。数据以dense格式存储低层级鼠标与键盘事件及因果模拟器状态,并通过alignment字段将观察结果与输入事件范围链接到特定节点,确保轨迹的可回溯性与结构完整性。
使用方法
数据集以三个文件形式提供:data.jsonl包含每条渲染轨迹的记录,screenshots目录下按轨迹名和节点ID存储PNG帧图像,videos目录提供完整的屏幕录制视频(WebM格式)。每条轨迹由36个样本组成,涵盖6家公司、923个帧图像,支持三种环境类型。使用者可通过解析JSONL文件的schema字段(包括trajectory_id、goal、tree.nodes、trajectory.input_events等)提取操作序列,结合帧图像与视频进行多模态分析与代理行为建模。
背景与挑战
背景概述
随着大型语言模型与图形用户界面交互能力的提升,构建能够模拟真实世界中多应用协同工作的数据集成为推进自主智能体研究的关键。SynthUX Computer-Use (economy sim) 数据集由SynthUX团队于2024年创建,旨在通过模拟企业内部多个工作人员在真实桌面环境中的计算机操作轨迹,填补现有数据集在跨应用、跨操作系统及多角色协作场景下的空白。该数据集涵盖了终端、代码编辑器、浏览器、邮件与即时通讯等原生应用,记录了低层级鼠标与键盘事件,为研究多步骤、多应用自主执行任务提供了高质量基准。其发布推动了GUI智能体从单一应用向复杂企业级工作流的进化,在计算机视觉、人机交互与智能体规划领域具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于:现有GUI智能体研究多局限于单一应用内的简单任务,而真实企业场景要求智能体能够跨应用、跨操作系统执行复杂工作流,同时保持对动态环境变化的因果适应。构建过程中面临的困难包括:需模拟多公司、多角色的经济仿真环境,确保每个操作轨迹的视觉内容具备足够多样性以避免过拟合;在无工作台覆盖的原生应用内精确记录低层级事件与屏幕视频的同步对齐;以及维持大规模多智能体模拟中,各实例间通信与状态变化的因果一致性,避免使用高层应用接口篡改观察结果。
常用场景
经典使用场景
在人工智能与图形用户界面智能体研究的交汇处,SynthUX Economy R2 W023数据集扮演着至关重要的角色。其最经典的使用场景在于评估和训练那些能够跨多个桌面应用程序执行复杂任务的语言驱动型GUI智能体。通过提供包括终端、笔记、代码编辑器、浏览器、即时通讯和邮件等在内的真实多应用环境,该数据集允许研究者构建能够理解自然语言目标、自主规划并执行跨应用程序操作的系统。每一个数据记录都封装了完整的屏幕录像、逐帧截图以及底层鼠标键盘事件的时间序列,这使得它成为刻画智能体在模拟企业环境中进行多步骤、多层级任务求解的理想基准。该场景不仅关注单步命令的完成度,更着重于智能体如何在长序列任务中保持目标一致性,并灵活应对不同操作系统和应用程序的差异。
实际应用
在产业界,此类数据集直接服务于企业级自动化与智能助手的技术迭代。实际应用场景涵盖了员工入职流程的自动化、跨系统数据同步与整理、以及基于自然语言指令的复合报表生成。例如,一名模拟员工可以通过语音或文本下达‘整理上季度各部门的销售报表,并生成一份PDF摘要发送给项目经理’的指令,智能体便需要依次操作邮件客户端下载附件、使用电子表格软件合并数据、通过办公演示软件创建汇报文稿,并最终通过即时通讯工具完成发送。SynthUX Economy R2 W023提供的多公司、多角色数据,使得相关系统能够学习到不同组织架构下的工作流模式,进而优化智能体的协作能力与角色适应性。这些能力一旦被成熟部署,将显著降低重复性办公协作的人力成本,并提升企业内部信息流转的效率。
衍生相关工作
基于该数据集已衍生出若干富有影响力的研究方向与经典工作。最直接的是对GUI智能体范式本身的深化,例如研究如何利用其提供的密集低层级输入事件序列,构建能够从视觉演示中直接学习操作策略的模仿学习模型。另一类衍伸工作聚焦于跨应用任务的规划与分解,利用该数据集的节点树结构,研究者得以探索如何将高层自然语言目标自动解构为可在多个独立应用程序中执行的子任务序列。此外,其明确的因果对齐信息催生了一批专注于智能体可解释性的工作,旨在通过回溯视频帧与输入事件的因果链条,让智能体的决策过程变得透明且可审计。这些衍生探索不仅丰富了GUI智能体的研究工具箱,也推动了该领域从简单的命令执行向复杂、可解释、可迁移的认知型智能体迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务