遇见数据集

jacob-valdez/synthux-economy-r4-w044

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SynthUX计算机使用数据集—经济模拟r4是一个由SynthUX生成的基于视觉的计算机使用轨迹数据集。每个记录代表一个工人在模拟公司内的设备会话:目标扩展为节点树,终端节点通过低级鼠标/键盘输入驱动真实的桌面模拟器应用(如终端、笔记、VS代码、浏览器、Slack/Teams、邮件、表格、幻灯片等),观察到的轨迹被记录为屏幕视频和每个节点的帧。该数据集支持应用原生的多应用程序执行(无工作台覆盖)、每个参与者的内容多样性、跨操作系统消息传递以及大型多公司经济模拟。每个经济模拟作为独立的数据集仓库发布。内容包括:data.jsonl(每个渲染轨迹一条记录)、screenshots/<trajectory>/<node_id>.png(每个终端节点在最后输入事件时的帧)和videos/<trajectory>.webm(完整屏幕录制)。记录模式包括轨迹ID、参与者ID、公司、角色ID、标题、环境(模拟器类型)、目标、树节点、轨迹输入事件、观察结果、对齐信息以及媒体文件。统计数据(本构建版本)显示:轨迹数36,视频36个,帧1029个,公司6个,按环境分布为browser-os(20)、macos-web-next(6)和windows-web-next(10)。数据生成使用SynthUX(synthux.multicompany.day.v1),观察结果具有因果性(突变通道为低级输入),在捕获过程中未使用高级应用程序突变。

SynthUX Computer-Use Dataset — economy sim r4 contains grounded visual computer-use trajectories generated by SynthUX. Each record is one workers device session inside a simulated company: a goal expands into a node tree, terminal nodes drive real desktop-simulator apps (Terminal, Notes, VS Code, Browser, Slack/Teams, Mail, Sheets, Slides, …) through low-level mouse/keyboard input, and the observed trajectory is recorded as a screen video plus per-node frames. It features app-native multi-application execution (no workbench overlay), per-actor content diversity, cross-OS messaging, and large multi-company economies, with each economy simulation published as its own dataset repo. Contents include: data.jsonl (one record per rendered trajectory), screenshots/<trajectory>/<node_id>.png (a frame per terminal node taken at that nodes last input event), and videos/<trajectory>.webm (the full screen recording). Record schema covers trajectory_id, actor_id, company, role_id, title, env (simulator type), goal, tree.nodes, trajectory.input_events, trajectory.observations, trajectory.alignment, media.video, and media.frames. Stats for this build: trajectories: 36, videos: 36 · frames: 1029, companies: 6, by env: browser-os (20), macos-web-next (6), windows-web-next (10). Provenance: Generated with SynthUX (synthux.multicompany.day.v1), observations are causal (mutation channel = low_level_input); no high-level app mutation is used during capture.

提供机构:
jacob-valdez
搜集汇总
数据集介绍
jacob-valdez/synthux-economy-r4-w044 数据集图片
构建方式
该数据集由SynthUX系统生成,聚焦于模拟公司环境中的图形用户界面(GUI)代理行为。每条记录代表一名工作人员在模拟公司中的设备会话:首先设定一个自然语言目标,该目标被扩展为节点树,终端节点通过低层级的鼠标与键盘指令驱动真实桌面模拟器应用(如终端、笔记、代码编辑器、浏览器、办公通讯及协作软件等),从而执行任务。完整的操作轨迹被记录为屏幕视频以及每个终端节点的帧图像。整个模拟过程基于因果观测机制,仅依赖低层级输入变化,避免了高层级应用突变干扰。
使用方法
数据以标准格式存储,便于研究者直接加载使用。`data.jsonl`文件包含每条轨迹的元数据与事件序列,其中`goal`字段提供任务目标,`tree.nodes`记录终端节点动作细节,`trajectory.input_events`与`trajectory.observations`则分别保存低层级输入事件及因果状态。配套的`screenshots`目录提供每节点截图,`videos`目录包含完整屏幕录像。用户可通过轨迹ID进行索引,结合对齐信息(`trajectory.alignment`)分析事件与节点间的映射关系,适用于GUI代理训练、行为建模及跨应用任务研究。
背景与挑战
背景概述
SynthUX Computer-Use (economy sim)数据集于2024年由SynthUX团队创建,旨在模拟多应用、多角色、多公司在桌面操作系统环境中的计算机使用行为,以推动GUI智能体(GUI Agents)研究的发展。该数据集通过SynthUX框架生成,记录模拟公司内部员工在真实桌面应用(如终端、浏览器、邮件、Slack、VS Code等)中的完整操作轨迹,包括鼠标和键盘的低级输入事件、屏幕视频以及关键帧截图。其核心研究问题在于如何构建可扩展、高保真的合成数据,以训练和评估能够在复杂多应用场景下自主完成目标的计算机视觉与交互智能体。该数据集以其细粒度的多应用协同执行、跨操作系统兼容性(macOS、Windows、浏览器OS)以及大规模经济模拟的独特结构,为GUI智能体领域提供了前所未有的基准资源,推动了从单应用到多应用、从孤立任务到组织级协作的研究范式变革。
当前挑战
该数据集及其领域面临的核心挑战首先在于真实世界计算机使用场景的高度复杂性:用户界面动态变化、应用间数据流动频繁、目标往往隐含在上下文之中,要求智能体同时具备视觉理解、符号推理和低级控制能力。构建过程中,SynthUX需要应对生成高质量合成轨迹的难题,包括如何确保操作序列的逻辑一致性、如何模拟真实用户行为中的自然变异(如不同角色的操作习惯、跨平台输入差异),以及如何在不引入高级API扰动的前提下保持因果链路的纯净性。此外,数据集的36条轨迹和1029个帧样本规模相对有限,如何在有限数据中覆盖丰富的经济角色(6家公司)、应用类型和环境组合(3种操作系统模拟器),同时避免过拟合和模式固化,是评估智能体泛化能力时的关键挑战。最后,合成数据与真实人类行为数据之间的分布差异(domain gap)要求研究者设计有效的迁移学习或域自适应策略。
常用场景
经典使用场景
在图形用户界面(GUI)智能体研究领域,SynthUX经济模拟数据集为多应用协同操作提供了高度真实的训练与评估平台。数据集包含36条完整的工作流轨迹,每一条均模拟了企业环境中不同角色(如财务分析师、供应链协调员)在MacOS、Windows及浏览器操作系统上,通过终端、笔记、代码编辑器、邮件、电子表格等桌面应用完成复杂经济任务的过程。这些轨迹以屏幕视频、逐帧截图及底层鼠标键盘事件的形式呈现,使研究人员能够精准捕捉人类操作序列与系统状态之间的因果关系。经典使用场景包括多步骤GUI任务的规划与执行能力测试、跨应用信息整合效率评估以及基于视觉输入的智能体泛化性能验证,尤其适合复现企业级办公场景中具有经济逻辑交互的复杂任务。
解决学术问题
长期以来,GUI智能体研究受限于数据集的静态性和任务单一性,难以反映真实多应用协作中的动态经济决策过程。该数据集通过构建包含6家虚拟公司、36条轨迹的模拟经济生态,解决了多应用、多角色、跨操作系统环境下因果时序建模的核心挑战。每个轨迹均记录从自然语言目标到终端节点执行的完整映射,并维持了底层输入与屏幕观察之间的严格因果链,这为研究如何从视觉观察中学习结构化任务分解、如何在多步操作中保持目标一致性、以及如何实现跨应用上下文迁移提供了稀缺的实证资源。其学术贡献在于突破了传统单应用基准的局限,使研究者能够系统性地探讨企业级工作流中智能体的鲁棒性与可解释性问题,并推动了基于因果推理的GUI自主操作理论发展。
实际应用
在实际产业应用中,该数据集直接服务于企业级流程自动化系统的研发与优化。例如,财务部门可利用其轨迹数据训练智能体自动完成跨系统的对账、预算汇总与报告生成;供应链团队可借鉴其中的多应用信息协调模式,开发能够同时在邮件、电子表格和协作平台间获取并整合数据的虚拟助手。数据集提供的多操作系统(包括浏览器原生环境)和跨公司数据多样性,还使得训练出的智能体具有更好的环境适应性和任务泛化能力,适用于SaaS平台集成、数字员工培训以及自动化测试工具的性能评估。此外,其因果标注结构使得企业可以基于特定安全策略进行行为约束,确保自动化流程符合合规与风控要求,从而降低大规模部署GUI智能体的初期开发成本和潜在风险。
数据集最近研究
最新研究方向
在当前图形用户界面(GUI)代理与多应用模拟的前沿探索中,SynthUX-economy-r4-w044 数据集聚焦于多公司经济仿真环境下的端到端视觉计算机使用轨迹生成。该研究围绕‘低层级输入驱动因果观测’的核心范式,在跨越多个操作系统(如 macOS、Windows、浏览器)的异构桌面环境中,记录职场角色通过鼠标、键盘等基础操作完成复杂跨应用任务(如终端、代码编辑器、通信软件、办公套件)的完整轨迹。这种合成数据生成策略不仅模拟了真实企业内部分工与跨部门协作的经济模式,还为构建能够理解多步意图、适应多平台交互的自主GUI智能体提供了高保真训练素材。其意义在于突破传统静态截图或单一应用操作的局限,推动面向大规模动态工作流理解的人工智能系统在自动化办公、数字员工等领域的可信部署。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务