遇见数据集

jacob-valdez/synthux-economy-r3-w003

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - other tags: - computer-use - gui-agents - synthetic - multi-application pretty_name: SynthUX Computer-Use (economy sim) --- # SynthUX Computer-Use Dataset — economy sim r3 Grounded visual computer-use trajectories generated by SynthUX. Each record is one worker's device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. App-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo. ## Contents - `data.jsonl` — one record per rendered trajectory. - `screenshots/<trajectory>/<node_id>.png` — a frame per terminal node, taken at that node's last input event. - `videos/<trajectory>.webm` — the full screen recording. ## Record schema | field | meaning | |---|---| | `trajectory_id` | unique id (`<actor>__<env>`) | | `actor_id`, `company`, `role_id`, `title` | who, in which org | | `env` | simulator: `macos-web-next` / `windows-web-next` / `browser-os` | | `goal` | natural-language goal for the session | | `tree.nodes` | the actor's terminal nodes (`surface`, `action`, `target`, `args`) | | `trajectory.input_events` | dense low-level mouse/keyboard/script events with `t_ms` | | `trajectory.observations` | causal simulator state after each node | | `trajectory.alignment` | links observations + input-event ranges to node ids | | `media.video` | screen recording (webm) | | `media.frames` | per-node PNG frames (node_id, t_ms, blob_ref) | ## Stats (this build) - trajectories: **36** - videos: 36 · frames: 1010 - companies: 6 - by env: browser-os (15), macos-web-next (14), windows-web-next (7) ## Provenance Generated with SynthUX (synthux.multicompany.day.v1). Observations are causal (mutation channel = low_level_input); no high-level app mutation is used during capture.

SynthUX Computer-Use Dataset — economy sim r3 is a dataset of grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies. Each economy simulation is published as its own dataset repo.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r3-w003 数据集图片
构建方式
该数据集基于SynthUX框架生成,模拟了多公司经济环境下的计算机使用轨迹。每个记录对应一名员工在模拟公司中的设备会话:一条自然语言目标被展开为节点树,终端节点通过低层级鼠标/键盘输入驱动真实的桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、即时通讯工具、邮件、表格处理、幻灯片等)。观察到的轨迹以屏幕视频和每个节点的截图形式记录。数据生成过程为因果式,仅通过低层级输入通道进行变异,未使用高层应用突变。
特点
数据集的核心特色在于其原生多应用执行能力(无工作台叠加层)、每个角色的内容多样性、跨操作系统通信以及大规模多公司经济模拟。每个轨迹包含密集的低层级输入事件(鼠标/键盘/脚本)及时间戳、因果模拟器状态、观察与输入事件到节点ID的对齐关系。本构建版本包含36条轨迹、1010帧截图、6家模拟公司,并覆盖macOS、Windows和浏览器三种操作系统环境。
使用方法
数据以data.jsonl文件存储每条轨迹的记录,每行对应一个JSON对象,包含轨迹ID、参与者信息、环境类型、目标描述、节点树、密集输入事件序列及对齐信息。媒体文件分别存储在screenshots/目录(每节点PNG截图)和videos/目录(WebM格式全屏录像)。用户可通过轨迹ID索引媒体文件,解析节点树与输入事件序列以复现或分析GUI代理行为,适用于多应用场景下的计算机使用轨迹研究与模型训练。
背景与挑战
背景概述
SynthUX Economy R3 W003数据集由SynthUX团队于近期创建,专注于模拟企业环境中的图形用户界面(GUI)代理行为。该数据集通过合成方式生成,涵盖多个操作系统(macOS、Windows、浏览器)及跨应用交互,旨在研究计算机使用场景下的多步骤任务执行。其核心研究问题是如何让AI代理在真实的桌面模拟器中,通过低层次的鼠标和键盘操作完成复杂的经济模拟目标。这一方向对智能体环境交互、任务规划及人机协作领域具有重要影响力,为验证GUI代理在动态多应用场景中的鲁棒性提供了基准。
当前挑战
该数据集面临的挑战主要包括:1)领域问题方面,GUI代理需处理跨应用、跨操作系统的非标准化界面,且经济模拟环境包含多公司、多角色动态交互,传统图像分类或自然语言处理模型难以直接迁移;2)构建过程中,合成轨迹需确保因果一致性,即低层输入事件与高层目标间的对齐,同时需生成多样化的内容以防过拟合,而36条轨迹和1010帧的有限规模可能限制模型泛化能力。此外,跨OS消息同步和实时屏幕录制增加了数据收集的复杂性。
常用场景
经典使用场景
该数据集最经典的使用场景在于训练与评估基于图形用户界面的智能代理(GUI Agents)。由于每个轨迹记录了模拟公司内员工在真实桌面应用(如终端、代码编辑器、浏览器、即时通讯工具等)之间的多应用交互过程,涵盖了从自然语言目标到低层级鼠标键盘指令的完整映射,因此非常适合作为多步骤、跨应用程序的自动化任务学习基准。研究者可以基于这些结构化轨迹训练模型从视觉观察中理解界面状态,并生成精确的交互动作序列。
实际应用
实际应用场景涵盖了企业级数字员工的自动化技能训练,例如实现跨应用的账务核对、多平台沟通自动回复、基于自然语言指令的数据查询与报表生成。借助该数据集训练的模型可以被部署在虚拟桌面环境中,自动执行诸如从邮件中提取订单信息并在工程管理系统中创建任务、在电子表格中更新预算并在幻灯片中同步展示等一系列繁琐操作。此外,它还可用于无障碍辅助技术开发,帮助残障人士通过语音指令完成多步骤界面交互。
衍生相关工作
该数据集衍生了若干重要的研究工作,主要包括面向多应用GUI操作的视觉语言模型微调方案,如将SynthUX轨迹与WebAgent、ScreenAgent等模型的训练范式结合,以增强模型在不同操作系统环境中的迁移能力。另一个相关方向是基于因果观测的鲁棒性训练策略,通过在仿真环境中引入随机突变来模拟真实世界的界面不确定性,从而提升代理在异常情况下的容错表现。此外,该数据集的层级化树状目标分解结构也为研究任务规划(Task Planning)与子目标推理提供了天然的监督信号。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务