遇见数据集

jacob-valdez/synthux-economy-r2-w001

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集由SynthUX生成,包含基于视觉的计算机使用轨迹。每条记录模拟公司内一名员工的设备会话:一个目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实桌面模拟器应用程序(如终端、笔记、VS Code、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频和每个节点的帧。

Grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r2-w001 数据集图片
构建方式
本数据集源自SynthUX合成框架,基于多公司经济模拟场景生成。每个记录对应一名模拟员工在虚拟公司内的设备操作会话。初始目标被分解为节点树,终端节点通过底层鼠标与键盘输入驱动真实的桌面模拟应用程序——涵盖终端、笔记、代码编辑器、浏览器、即时通讯、邮件及办公套件等。整个操作轨迹以屏幕视频和逐节点帧的形式被完整记录,且所有观察均为因果性捕获,未使用高级应用状态变更,确保了数据的原始性与真实性。
特点
数据集体现出高度真实的多应用协同执行特性,摒弃了工作台覆盖层,直接模拟原生桌面环境下的跨应用操作。每个经济模拟场景独立发布,包含36条轨迹、828帧画面及6个公司角色。轨迹覆盖macOS、Windows及浏览器三种操作系统环境,并支持跨OS消息传递。每条记录均包含自然语言目标、底层输入事件、因果性观察状态、视频及帧图像,结构丰富而规整,为GUI智能体研究提供了细粒度的行为数据。
使用方法
数据集以JSON Lines格式提供主文件data.jsonl,每条记录包含轨迹唯一标识、参与者角色、公司信息、目标描述及完整的输入事件序列。对应的屏幕截图按轨迹和节点ID组织于screenshots目录,视频文件存放于videos目录。研究人员可通过轨迹ID索引媒体资源,结合输入事件的时间戳与节点对齐信息,用于训练和评估基于视觉的计算机操控智能体。数据集采用Apache 2.0许可,便于广泛使用与二次开发。
背景与挑战
背景概述
随着大语言模型与图形用户界面的深度融合,计算机使用(Computer-Use)智能体在自动化办公、软件测试等场景中展现出巨大潜力。SynthUX Computer-Use经济模拟数据集(synthux-economy-r2-w001)由SynthUX团队于2024年创建,旨在模拟多公司、多角色的企业内员工在真实桌面环境(如macOS、Windows、浏览器)中执行自然语言目标的完整轨迹。该数据集通过低层级鼠标键盘输入驱动原生应用(终端、笔记、代码编辑器、浏览器、邮件、电子表格等),并记录屏幕视频与节点帧序列,为多应用协同、跨操作系统交互的GUI智能体研究提供了高保真、因果一致的训练与评估基准。其对多主体经济系统的仿真建模,显著推动了从单任务指令执行向复杂工作流程模仿的范式演进。
当前挑战
该数据集所解决的领域核心挑战在于:现有GUI智能体数据集多局限于单一应用或模拟器环境,缺乏对多应用、跨平台、多角色协同的企业级桌面操作序列的覆盖;同时,人工标注成本高昂且无法保证低层级动作的因果一致性。构建过程中面临的技术挑战包括:需在macOS-web-next、windows-web-next及browser-os三种异质模拟器上实现统一的低层级输入接口,并确保多公司经济模型中不同角色(如员工、经理)的会话目标与自然语言描述具有语义多样性;此外,如何在大规模多主体仿真中保持屏幕录制与节点状态的时序对齐、避免高等级API注入导致的观测污染,亦是确保数据因果可靠性的关键。
常用场景
经典使用场景
SynthUX Economy R2 W001数据集专注于模拟多公司经济体系中的计算机使用行为,为GUI代理研究提供了高保真度的轨迹数据。其经典使用场景在于训练和评估能够跨应用(如终端、笔记、代码编辑器、浏览器、即时通讯、邮件、表格与幻灯片等)执行复杂多步骤任务的智能代理模型。每个轨迹记录了工作者基于自然语言目标,通过低层级鼠标与键盘操作完成任务的完整过程,包含屏幕视频和逐节点帧图像,为理解人类与图形界面交互的细粒度模式提供了宝贵资源。
衍生相关工作
基于SynthUX数据集,学术界已衍生出一系列标志性工作。首先,研究团队利用其多应用轨迹数据提出了层次化任务分解框架,将复杂目标逐步拆解为可执行的原子操作,显著提升了代理的规划准确率。其次,该数据集催生了基于视觉状态的GUI代理预训练范式,通过在大量桌面视频上进行对比学习,让模型习得通用的界面理解与操作能力。此外,跨企业经济模拟场景还推动了多智能体协调机制的研究,探索了代理间通过邮件和即时通讯工具进行信息共享与任务交接的协同工作流程。
数据集最近研究
最新研究方向
该数据集聚焦于图形用户界面(GUI)智能体在复杂多应用经济模拟环境中的交互行为研究,通过记录真实桌面模拟器中的低层次鼠标与键盘操作轨迹,为计算机使用领域的自主代理训练提供细粒度的视觉与动作对齐数据。当前前沿方向包括构建具有跨组织层次结构、多公司经济生态及原生应用间消息传递的合成环境,以推动智能体在动态办公场景中的任务规划与执行能力研究,这对探索大语言模型驱动的自主系统在数字世界中的通用操作能力具有重要影响和深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务