遇见数据集

jacob-valdez/synthux-economy-r4-w026

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集(经济模拟版本r4)是一个基于视觉的计算机使用轨迹数据集,由SynthUX生成。每个记录代表一个工人在模拟公司内的设备会话:目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实桌面模拟器应用(包括终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频加上每个节点的帧。该数据集支持应用原生多应用执行(无工作台覆盖),每演员内容多样性,跨操作系统消息传递,以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。数据集内容包括data.jsonl文件(每个渲染轨迹一条记录)、screenshots文件夹(每个终端节点的帧,在节点的最后一个输入事件时拍摄)和videos文件夹(完整屏幕录制)。记录模式包括轨迹ID、演员ID、公司、角色、标题、环境、目标、节点树、输入事件、观察、对齐和媒体信息。统计显示本构建包含36个轨迹、36个视频、1026帧、6个公司,环境分布为browser-os(16)、macos-web-next(6)和windows-web-next(14)。数据生成使用SynthUX工具,观察基于因果模拟(突变通道为低级输入),捕获过程中未使用高级应用突变。

The SynthUX Computer Usage Dataset (Economic Simulation Version r4) is a vision-based computer usage trajectory dataset generated by SynthUX. Each record represents a worker's device session within a simulated company: goals are expanded into node trees, and terminal nodes drive real desktop simulator applications (including terminals, note-taking tools, VS Code, browsers, Slack/Teams, email clients, spreadsheets, presentation software, etc.) via low-level mouse/keyboard inputs. The observed trajectories are recorded as screen videos plus frames for each terminal node. This dataset supports native multi-application execution (without workspace overlay), content diversity per actor, cross-OS messaging, and large-scale multi-company economic simulations. Each economic simulation is released as an independent dataset repository. The dataset contents include the data.jsonl file (one record per rendered trajectory), the screenshots folder (frames of each terminal node captured at the time of the node's final input event), and the videos folder (full screen recordings). Recorded fields include trajectory ID, actor ID, company, role, title, environment, goal, node tree, input events, observations, alignments, and media information. Statistics show that this build contains 36 trajectories, 36 videos, 1026 frames, and 6 companies, with an environment distribution of browser-os (16), macos-web-next (6), and windows-web-next (14). The data was generated using the SynthUX tool, with observations based on causal simulation (using low-level inputs as the mutation channel), and no high-level application mutations were utilized during the capture process.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r4-w026 数据集图片
构建方式
该数据集源自SynthUX框架,聚焦于模拟公司环境中的经济模拟场景。每个数据记录对应一位员工在模拟设备上的会话,系统将自然语言目标分解为节点树,终端节点通过底层鼠标与键盘操作驱动多个桌面模拟应用,包括终端、笔记、代码编辑器、浏览器及通讯与办公软件等。执行过程以应用原生方式运行,无工作台覆盖,确保交互的真实性。同时,每位参与者拥有多样化的内容,并支持跨操作系统间的消息通信,构建起大型多公司经济生态。每个经济模拟均独立发布为单独的数据集仓库,本版本为第四次运行,共包含36条轨迹,对应6家不同的公司实体。
特点
本数据集的核心特征在于其多应用原生执行环境,摒弃了传统工作台重叠的抽象方式,直接模拟真实的桌面交互。跨操作系统的消息机制与多公司经济结构的设计,引入了丰富的社会与组织复杂性。数据规模方面,该版本包含36条轨迹、1026帧画面及36段视频,覆盖了macOS、Windows及浏览器三种模拟环境,展现了不同操作系统下的界面多样性。每个轨迹均保留了完整的低层级输入事件流与因果性的观察状态,确保了行为记录的可复现性与精细度。
使用方法
数据集以标准格式存储,主文件data.jsonl中每条记录包含轨迹标识符、参与者信息、自然语言目标、节点树结构及密集的低层级输入事件序列。配套的screenshots目录按轨迹组织,提供每个终端节点对应的PNG帧,记录该节点最后一次输入事件时的屏幕状态;videos目录则存放完整的屏幕录像WebM文件。研究人员可通过轨迹中的input_events字段获取带时间戳的鼠标与键盘操作序列,结合observations字段中的因果状态,重构完整的交互过程。alignment字段进一步将观察结果与输入事件区间映射至特定节点,便于进行细粒度的行为分析与模型训练。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim) 数据集诞生于多智能体系统与图形用户界面自动化的交叉前沿,由SynthUX团队于近期构建,旨在模拟真实企业环境中计算机使用行为的复杂动态。该数据集聚焦于经济模拟场景,记录了六家虚拟公司内员工在桌面操作系统(macOS、Windows及浏览器环境)中完成多应用协作任务的完整轨迹,涵盖终端、代码编辑器、浏览器、邮件及办公套件等工具。其核心研究问题在于如何通过低层级鼠标/键盘事件捕获与细粒度对齐,实现跨应用、跨操作系统的图形界面代理行为的可复现建模。作为首个公开的多公司经济模拟计算机操作数据集,它为GUI智能体研究提供了因果可追溯的观察数据,对推动自主工作流自动化与组织行为模拟领域具有奠基性影响。
当前挑战
该数据集面临的挑战呈现多维度特性。领域层面,现有计算机使用数据集多局限于单一应用或孤立任务,而真实企业流程要求代理在邮件、文档、代码编辑与即时通讯等异构应用间无缝切换,且需应对操作系统级跨平台兼容性差异,这对模型的环境感知与任务规划能力构成严峻考验。构建过程中,数据生成需依赖SynthUX框架在无高层应用变异干预下,通过底层输入事件驱动仿真器产生因果一致轨迹,同时保证每位员工的个性化内容多样性——如何平衡模拟效率与真实度、确保低层级事件与高层语义目标的精准对齐,以及处理多公司经济交互中罕见的边缘案例,均为当前技术瓶颈。
常用场景
经典使用场景
在计算机视觉与智能体交互的交叉领域,SynthUX Economy模拟数据集为多应用环境下的图形用户界面(GUI)智能体研究提供了宝贵的资源。该数据集通过模拟公司内部员工在真实操作系统(macOS/Windows)及浏览器环境中的设备操作轨迹,构建了涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件、电子表格和幻灯片等多元应用的复杂任务场景。每一个轨迹均源自自然语言目标驱动,经由层级化节点树展开,最终落地为低层级鼠标与键盘的精确输入。经典使用范式包括利用这些轨迹进行多步骤任务规划、跨应用状态追踪以及GUI交互策略的学习与评估,为开发能够理解并操作真实桌面环境的通用智能体奠定了数据基础。
实际应用
在实际产业层面,该数据集最直接的价值在于赋能企业级自动化软件测试与数字员工训练。现代企业工作流往往横跨邮件审批、代码审查、即时通讯协调和演示文稿制作等多个桌面应用,传统的脚本化工具对此类动态、多变的场景力不从心。基于SynthUX Economy提供的36条高质量轨迹,开发者可以微调视觉语言模型(VLM)或训练基于行为克隆的智能体,使其学会诸如“根据Slack消息更新会议幻灯片数据”、“在VS Code中修正Bug后通过邮件通知团队”等具身式协作任务。此外,该数据对跨操作系统(浏览器与桌面原生应用)交互的支持,使其成为构建下一代远程桌面助手或企业内部RPA(机器人流程自动化)2.0系统的理想训练基石。
衍生相关工作
该数据集的发布催生了一系列具有启发性的衍生工作。首先,研究者可以利用其“per-node帧+密集输入事件”的多模态结构,开发出基于时间对齐的节点间状态差异分析方法(如帧差值编码),从而构建更高效的屏幕理解模型。其次,由于每个轨迹都包含明确的actor身份、公司归属及角色title,这催生了基于社会模拟的智能体角色建模工作——例如研究不同权限级别(如开发者与管理员)在跨应用任务中的操作模式差异。最后,数据集中记录的因果模拟器状态序列,为因果表示学习提供了天然基准,衍生出预测“低层输入导致应用状态跃迁”的前向模型,这些模型进而被用于构建无模型强化学习环境,使智能体能在离线轨迹上学习,而无需在线交互昂贵的目标应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务