遇见数据集

WildGUI

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

WildGUI是一个用于GUI代理预训练的大规模数据集,源自Video2GUI项目,通过从互联网教程视频中提取和注释构建而成。该数据集经过重新处理和清理,以JSONL分片形式发布,便于检查、重用和复现。每个记录代表一个任务级的GUI交互,包含视频标识符、任务指令、密集自然语言摘要、高层任务计划、平台上下文(如Web、桌面或移动)、软件或网站信息,以及有序的GUI动作轨迹。轨迹中的每个动作包括时间戳、动作类型(如移动、点击、输入、滚动等)、接地指令、动作原因、核心变更描述,以及可选的接地参数(如坐标、文本、按键等)。数据规模在1000万到1亿之间,适用于GUI代理、GUI接地、动作预测、交互轨迹建模和多模态代理预训练的研究。需要注意的是,注释自动从视频中派生,可能包含噪声,用户在下游训练或评估时应验证数据,特别是对于空间接地信息;当use_grounding字段为false时,应避免将移除的坐标或参数视为有效监督。

WildGUI is a large-scale dataset for GUI agent pre-training, derived from the Video2GUI project, constructed by extracting and annotating from internet tutorial videos. The dataset has been reprocessed and cleaned, released in JSONL shards for easy inspection, reuse, and reproduction. Each record represents a task-level GUI interaction, containing a video identifier, task instruction, dense natural language summaries, high-level task plans, platform context (e.g., Web, desktop, or mobile), software or website information, and ordered GUI action trajectories. Each action in the trajectory includes a timestamp, action type (e.g., move, click, type, scroll, etc.), grounding instruction, action reason, core change description, and optional grounding parameters (e.g., coordinates, text, keys, etc.). The data scale ranges from 10 million to 100 million and is suitable for research on GUI agents, GUI grounding, action prediction, interaction trajectory modeling, and multimodal agent pre-training. Note that annotations are automatically derived from videos and may contain noise; users should verify the data for downstream training or evaluation, especially for spatial grounding information; when the use_grounding field is false, removed coordinates or parameters should not be treated as valid supervision.

创建时间:
2026-06-04
原始信息汇总

数据集概述

WildGUI 是一个用于 GUI Agent 预训练的大规模交互轨迹数据集,来源于互联网上的教程视频,由 Video2GUI 项目构建。本仓库提供的是经过个人重新处理和清洗的标注版本。

基本信息

  • 许可协议:CC-BY-NC-4.0
  • 语言:英语
  • 标签:GUI agents, GUI grounding, interaction trajectories, video2gui, web, desktop, mobile
  • 数据规模:10M < 样本数 < 100M

文件结构

数据以 JSONL 分片形式组织,文件名遵循以下模式:

wildgui_part1.jsonl wildgui_part2.jsonl wildgui_part3.jsonl wildgui_part4.jsonl

每行是一个任务级别的 JSON 对象。原始的 Annotations 按 task_id 拆分,每个记录包含一个独立的 GUI 任务及其有序的动作轨迹。

记录结构

顶层字段:

字段 类型 描述
video_id string 源视频标识符
segment_index integer 在源视频中的片段索引
task_id integer 拆分后的任务标识符
instruction string 自然语言任务指令
dense_caption string GUI 行为的密集自然语言摘要
plan string 高级任务计划
platform string 平台上下文,如 web、desktop、mobile
software string 交互中使用的应用程序或软件
website string 适用的网站或 Web 服务
trajectories list 任务的有序 GUI 动作序列

trajectories 中每个动作对象的常见字段:

字段 类型 描述
timestamp string 动作在源视频片段中的时间戳
action_type string 动作类别,如 moveTo、click、typing、scrolling、keyboard operation
grounding_instruction string 目标 GUI 元素或动作目标的自然语言描述
action_reason string 执行动作的原因
action_parameters object, optional 接地参数,如 point、bbox、text、key、start_point、end_point、direction 或 duration 字段。当无法获得可靠接地数据时省略此字段
core_change_reason string 预期或观察到的 GUI 状态变化的解释
core_change string 动作后主要 GUI 状态变化的描述
effects_on_success string, optional 关于动作如何影响任务完成的额外说明
finish_reason string, optional 轨迹或任务被认为完成的原因
use_grounding boolean 是否应使用接地的动作参数

使用场景

WildGUI 旨在用于 GUI Agent、GUI 接地(GUI grounding)、动作预测、交互轨迹建模以及多模态 Agent 预训练的研究。

注意事项

  • 标注数据自动从教程视频中导出,可能包含噪声。用户应自行验证数据在其下游训练或评估场景中的适用性。
  • 对于 use_grounding: false 的动作应使用自然语言动作上下文,但避免将移除的坐标或参数视为有效的监督信号。

数据加载

从 Hugging Face Hub 加载:

python from datasets import load_dataset dataset = load_dataset( "xwm/WildGUI", data_files="wildgui_part*.jsonl", split="train", )

从本地文件加载:

python from datasets import load_dataset dataset = load_dataset( "json", data_files="/path/to/wildgui_part*.jsonl", split="train", )

引用

如需引用此重新处理的标注版本,请引用 Video2GUI 论文:

bibtex @misc{xiong2026video2gui, title = {Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining}, author = {Xiong, Weimin and Gu, Shuhao and Ye, Bowen and Yue, Zihao and Li, Lei and Song, Feifan and Li, Sujian and Tian, Hao}, year = {2026}, eprint = {2605.14747}, archivePrefix = {arXiv}, primaryClass = {cs.CL}, doi = {10.48550/arXiv.2605.14747}, url = {https://arxiv.org/abs/2605.14747} }

搜集汇总
数据集介绍
WildGUI 数据集图片
构建方式
WildGUI数据集源自Video2GUI项目,通过从大规模互联网教学视频中提取GUI交互轨迹构建而成。其构建流程涵盖视频分割、任务识别与动作序列标注等环节,最终以JSONL分片格式存储。每条记录对应一个独立的GUI任务,包含来自原始视频片段的多模态信息,如自然语言指令、密集字幕描述、高层任务规划以及有序的动作轨迹数据。
特点
该数据集规模庞大,样本量介于千万至亿级之间,覆盖网页、桌面和移动端等多种平台环境,并涉及多样的应用软件与网站。其独特之处在于提供了细粒度的动作级标注,包括动作类型、目标元素的地面实况指令、操作缘由及预期状态变化等字段,同时支持空间定位参数的显式使用或自然语言上下文的灵活切换。
使用方法
研究者可通过HuggingFace Datasets库直接加载分片数据,例如使用'load_dataset("xwm/WildGUI", data_files="wildgui_part*.jsonl", split="train")'命令。该数据集适用于GUI智能体、交互轨迹建模、多模态预训练及动作预测等研究方向,使用时需注意自动标注可能存在的噪声,并依据'use_grounding'标志判断空间定位参数的可靠性。
背景与挑战
背景概述
随着图形用户界面(GUI)的普及,自动化GUI操作代理的构建成为人机交互领域的前沿课题。2026年,由熊伟民、顾书豪等研究者发表的Video2GUI项目引入了WildGUI数据集,旨在从大规模互联网教程视频中提取交互轨迹,为通用型GUI代理的预训练提供基础。该数据集主要由清华大学等机构联合开发,核心研究问题聚焦于如何通过自然语言指令与多平台操作序列的映射,驱动GUI代理完成跨网页、桌面及移动端的复杂任务。WildGUI覆盖了超过千万级别的动作轨迹样本,其发布为GUI基础模型的研究提供了重要的数据支撑,显著推动了代理在零样本环境下理解界面并执行多步操作的能力。
当前挑战
WildGUI面临的首要挑战是领域问题的复杂泛化:GUI代理需理解异构平台的布局差异(如网页、桌面与移动端),并在仅有自然语言指令引导下完成跨越不同软件与网站的操作任务,这要求模型突破传统图像分类或指令跟随的边界。此外,数据构建过程中的挑战同样严峻:标注由自动管道从视频中提取,包含时空对齐误差与动作歧义,例如部分轨迹缺乏精确的屏幕坐标参数,仅依赖文本描述作为监督信号。同时,任务粒度分割(如按task_id拆分多步骤序列)可能引入不完整或噪声示例,下游使用时需谨慎验证数据质量,以确保空间定位信息的有效性。
常用场景
经典使用场景
WildGUI数据集专为图形用户界面智能体(GUI Agent)的研究而设计,其核心应用场景集中于跨平台、跨应用的GUI交互建模与预训练。该数据集从大规模网络教程视频中自动提取并重构了海量的、带有精细标注的用户操作轨迹,涵盖网页、桌面及移动端等多种平台环境。通过提供包括自然语言指令、动作序列、元素定位参数及状态变化描述在内的结构化数据,WildGUI使得研究者能够训练模型理解高层次的用户意图,并将其分解为具体的、有序的界面交互步骤,从而为构建能够在复杂数字环境中自主完成任务的通用型GUI Agent奠定了坚实的数据基础。
衍生相关工作
WildGUI的发布催生了一系列前沿研究工作,其生成框架Video2GUI本身即为一项开创性工作,展示了如何从视频中合成交互轨迹以用于Agent预训练。在此基础之上,衍生工作主要分为三个方向:一是利用WildGUI的轨迹数据进行GUI基座模型的预训练与微调,如开发能够进行动作定位与状态预测的专用编码器;二是基于其密集语言注释,探索更优的指令跟随与任务规划算法,例如将长程任务分解为可执行的子目标序列;三是将WildGUI作为跨平台基准测试集,评估不同模型在真实世界GUI任务上的泛化性能。这些工作共同推动了GUI Agent领域从基于规则的方法向数据驱动的深度学习范式的转变。
数据集最近研究
最新研究方向
WildGUI作为由大规模互联网教程视频自动标注构建的数据集,为GUI代理的预训练提供了崭新的数据范式。当前领域的前沿研究正聚焦于如何利用此类蕴含丰富交互轨迹与细粒度语义标注的资源,推动GUI感知与操作模型的泛化能力。随着多模态大模型在图形用户界面中的萌芽应用,诸如基于视觉信号的元素定位、动作轨迹预测以及任务级规划等方向持续升温,WildGUI凭借其跨平台(web、desktop、mobile)的多元场景和包含动作参数、状态变化等结构化轨迹信息的优势,成为连接视频理解与代理行为的桥梁。该数据集的发布不仅填补了大规模、多平台GUI交互训练数据的缺口,还为未来构建能够从真实操作视频中学习并迁移的通用智能体注入了强劲动力,其影响有望涵盖从自动化测试到辅助交互等广泛领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务