遇见数据集

dad3131/GUIOdyssey

收藏
Hugging Face2025-12-19 更新2025-12-20 收录
官方服务:

资源简介:

GUIOdyssey是一个用于训练和评估跨应用导航代理的综合数据集。该数据集包含来自6种移动设备的8,334个任务片段,涵盖6种跨应用任务类型、212个应用和1.3K个应用组合。数据集提供了丰富的语义注释,包括每个步骤的细粒度低级指令、图像描述、动作意图和上下文回顾。此外,还为每个点击的元素提供了边界框,以实现更准确的评估。数据集支持多种分割方式(随机分割、任务分割、设备分割和应用分割),以评估代理在不同场景下的泛化能力。

GUIOdyssey is a comprehensive dataset for training and evaluating cross-app navigation agents. It consists of 8,334 episodes from 6 mobile devices, spanning 6 types of cross-app tasks, 212 apps, and 1.3K app combos. The dataset features rich semantic annotations, including fine-grained low-level instructions, image descriptions, action intentions, and context review for each step. Additionally, it provides bounding boxes for each clicked element, enabling more accurate evaluation. The dataset supports multiple splitting methods (random_split, task_split, device_split, and app_split) to evaluate the agents generalization capabilities across different scenarios.

提供机构:
dad3131
搜集汇总
数据集介绍
构建方式
GUIOdyssey数据集由来自6种移动设备的8,334个交互片段构成,覆盖212个应用及1,300余种应用组合,聚焦于跨应用导航任务。每个片段包含详细的步骤级标注,包括屏幕截图、动作类型(点击、滚动、长按、输入、完成、未完成)及其坐标信息,并额外提供由SAM2分割的点击元素边界框。数据采集依托Android模拟器,涵盖Pixel Fold、Pixel Tablet等不同设备形态,确保设备多样性与场景丰富性。标注体系不仅包含低层级指令与动作意图,还融入了历史上下文回顾与屏幕内容描述,从而构建出层次分明、语义密集的数据结构。
特点
该数据集的核心特点在于其跨应用导航任务的深度覆盖与精细化标注。相较于早期版本,新增了更细粒度的低层级指令、图像描述、动作意图及上下文回顾,提升了每一步操作的语义可解释性。数据集设计了四种划分策略——随机划分、任务划分、设备划分与应用划分,分别用于评估智能体在域内与域外场景下的泛化能力。此外,每个交互片段均包含完整的设备信息与任务元数据,支持对任务类别、应用组合及设备特性的多维度分析,为跨应用GUI智能体的训练与评测提供了系统化的基准。
使用方法
使用GUIOdyssey时,首先需通过分卷解压命令提取127,893张屏幕截图,随后加载JSON格式的标注文件'all_annot.json'。数据集以HuggingFace Datasets库的配置方式提供,可通过'default'配置直接读取全部片段。研究者在训练或评估过程中,可根据需求选择random_split、task_split、device_split或app_split等划分方式,以测试模型在不同分布下的表现。标注字段中,'low_level_instruction'与'intention'可用于监督学习中的动作预测与推理建模,'sam2_bbox'则支持基于视觉定位的评估。建议优先使用最新版本以获得更丰富的语义信息与更准确的评估能力。
背景与挑战
背景概述
GUIOdyssey数据集由上海人工智能实验室OpenGVLab团队于2024年提出,旨在解决移动设备上跨应用图形用户界面(GUI)导航这一新兴研究问题。随着智能手机功能的日益复杂,用户常需在多个应用间协同操作完成复杂任务,而现有数据集多聚焦于单一应用内的交互。该数据集包含8334个跨应用导航片段,覆盖6种任务类型、212个应用及1300余种应用组合,数据采集自6种不同设备。其核心研究价值在于为训练和评估能够理解跨应用上下文、执行多步操作的智能体提供标准化基准,对推动自主GUI代理从实验室场景向真实用户场景迁移具有重要影响。
当前挑战
数据集面临的核心挑战首先体现在跨应用导航的复杂性问题:智能体需同时理解多个应用的状态转换、任务意图分解以及操作序列的长期依赖性,这与单应用场景存在本质差异。其次,构建过程中面临数据采集与标注的双重困难:跨应用操作需在模拟器上编排复杂任务流程,确保任务模板的多样性与现实性;同时为每步操作提供细粒度语义标注,包括屏幕描述、动作意图、上下文回顾及UI元素边界框,这对标注一致性和质量控制提出极高要求。此外,不同设备尺寸与系统版本的差异进一步增加了数据泛化的难度,需要在数据划分时系统评估智能体的域内与域外性能。
常用场景
经典使用场景
GUIOdyssey数据集专为训练与评估跨应用图形用户界面(GUI)导航智能体而设计,其核心应用场景涵盖移动设备上多步骤、跨应用的复杂任务执行。该数据集包含来自6种不同虚拟设备的8,334个任务片段,覆盖212个应用程序及1,300余种应用组合,任务类型涉及多应用协作、网络购物、信息管理、媒体娱乐等六大类别。每一操作步骤均配有细粒度的低级指令、屏幕截图、动作意图与上下文回顾,并提供了基于SAM2分割的点击元素边界框,从而为构建能够理解并执行跨应用导航的自主智能体提供了标准化的训练与评测基准。
解决学术问题
该数据集有效解决了现有GUI导航研究长期局限于单应用场景的瓶颈问题。传统数据集如MoTIF或AITW多聚焦于单一应用内的操作序列,缺乏对跨应用任务中应用切换、数据传递与上下文维护等复杂交互行为的建模。GUIOdyssey通过系统性地收集跨应用任务片段,并引入任务分割、设备分割、应用分割等多种数据划分策略,为评估智能体在分布外(out-of-domain)场景下的泛化能力提供了严谨的学术框架。其发布推动了移动端自主导航从封闭域向开放域的跃迁,为研究任务迁移、零样本泛化及多应用协作推理等前沿问题奠定了数据基础。
衍生相关工作
GUIOdyssey的发布催生了一系列衍生研究工作,主要集中在跨应用导航智能体的架构设计与评估方法创新。例如,研究者基于该数据集提出了结合视觉语言模型与结构化记忆机制的导航框架,利用数据集中的上下文回顾字段增强智能体的长程推理能力。同时,数据集中提供的多种数据分割方式(如任务分割与应用分割)被广泛用于设计泛化性评测基准,衍生出诸如“零样本跨应用导航”与“少样本任务适应”等研究子方向。此外,该数据集与开源仓库中配套的评测流水线,已成为后续工作如GUI grounding与多模态动作预测的标准对比平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务