遇见数据集

appgen-eval-assets

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

appgen-eval-assets是一个用于评估在appgen模拟器上训练的移动图形用户界面(GUI)代理的数据集。该数据集包含一个主要的持有评估集,包含40个独立环境,共计194个任务,任务路径长度在4到20步之间,涵盖10个不同的任务类别。这些评估环境与所有训练数据集完全不相交,确保了评估的公正性。数据集还提供了一个包含28个环境的短任务子集,适用于快速验证和检查。此外,数据集包含完整的评估工具链,包括评估脚本(assets_eval_appgen.py)、源代码目录(src/)和提示词模板(prompts/)。评估指标明确定义为:成功需要代理到达任务的目标页面并正确发出终止指令(terminate)。输出结果包含每个任务的详细分析,包括路径长度、成功状态和步骤准确率,支持按任务长度进行细分分析。该数据集适用于移动GUI自动化代理的基准测试和性能评估,特别是在零样本或少量样本的泛化能力测试场景中。

appgen-eval-assets is a dataset for evaluating mobile graphical user interface (GUI) agents trained on the appgen simulator. The dataset includes a main hold-out evaluation set with 40 independent environments, totaling 194 tasks, with task path lengths ranging from 4 to 20 steps, covering 10 distinct task categories. These evaluation environments are completely disjoint from all training datasets, ensuring fairness in evaluation. The dataset also provides a short-task subset with 28 environments, suitable for quick validation and inspection. Additionally, the dataset includes a complete evaluation toolchain, comprising evaluation scripts (assets_eval_appgen.py), source code directories (src/), and prompt templates (prompts/). The evaluation metrics are clearly defined: success requires the agent to reach the target page of the task and correctly issue a termination instruction (terminate). The output results contain detailed analyses for each task, including path length, success status, and step accuracy, supporting segmented analysis by task length. This dataset is suitable for benchmarking and performance evaluation of mobile GUI automation agents, particularly in scenarios testing zero-shot or few-shot generalization capabilities.

创建时间:
2026-07-07
原始信息汇总

数据集概述:appgen-eval-assets

该数据集提供了用于评估移动GUI智能体的留出(held-out)评估环境和测试工具,专门针对在appgen模拟器上训练的智能体(如appgen-training-data / appgen-sft-data数据集训练的模型)进行性能评测。

核心内容

数据集包含多个压缩包和脚本文件,主要文件及其用途如下:

文件 说明
reach_assets.tar.gz 主要留出测试集:包含40个环境(pool_v3/envs)、194个任务(路径长度4-20,覆盖10个类别),以及评估工具assets_eval_appgen.py、源代码src/和提示词prompts/。环境与所有训练池完全无重叠
reach_assets_short.tar.gz 28个环境的短任务子集,适用于快速检查。
eval_suite.tar.gzdiscrim_assets.tar.gz 辅助测试套件。
grounding_qwen3/ 基础对位基准测试结果JSON文件。
probe_artifacts/ 法证探针日志/结果(用于reach-vs-terminate分析)。
probe_make_tasks.py 确定性单步探针任务构建脚本。
reach_diag.py reach-vs-terminate诊断运行器。
v3_code_bundle.tar.gz 运行时补丁和作业YAML快照(用于复现性)。

使用方法

运行留出评估的基本命令如下(需解压reach_assets.tar.gz后执行):

bash tar xzf reach_assets.tar.gz && cd reach_assets python assets_eval_appgen.py --model_path <ckpt-or-hf-id> --env_dir pool_v3/envs --num_gpus 1 --max_turns 25 --output_file result.json

评估规则与输出

  • 成功标准:智能体到达任务目标页面并发出terminate信号即为成功。
  • 模型兼容性
    • Qwen2.5系列:使用绝对坐标(默认)。
    • Qwen3系列:需将代码中两个cs = ... "absolute"位置修改为"normalized",并将MOBILE_SYSTEM_PROMPT_PATH切换到system_prompt_qwen3_mobile.txt
  • 输出数据:结果JSON中的per_task字段包含每个任务的path_length(路径长度)、success(成功与否)、step_accuracy(步骤准确率),可用于按路径长度进行性能分析。
搜集汇总
数据集介绍
appgen-eval-assets 数据集图片
构建方式
该数据集专为评估基于Appgen模拟器训练的移动端GUI智能体而设计,构建了与训练环境完全不相交的留出评估集合。核心资源包含40个独立环境、194个任务,路径长度介于4至20步,横跨10个应用程序类别。数据集附带完整的评估框架、源代码及提示模板,并额外提供28个环境的短任务子集用于快速检查,以及多组辅助套件,共同支撑多层次、高覆盖度的性能验证。
使用方法
使用过程简洁高效:解压主评估套件后,通过命令行调用内置的评估脚本,指定模型路径、环境目录、GPU数量及最大交互轮次即可启动评估。针对不同模型需进行细微适配,例如Qwen3模型应切换至归一化坐标并更换专用提示模板。数据集还提供了确定性单步探针任务构建工具及到达与终止诊断运行器,便于研究者开展定向问题分析和模型行为归因。
背景与挑战
背景概述
在移动图形用户界面(GUI)智能体研究领域,模型在模拟环境中训练后的泛化能力评估一直是关键挑战。appgen-eval-assets数据集由移动GUI智能体研究团队于近期创建,旨在提供与训练数据完全独立的评估环境与测试框架。该数据集的核心贡献在于其精心设计的40个环境、194个任务,覆盖10个类别,路径长度4-20步,所有环境均与appgen训练池无重叠,从而保证评估的公平性与客观性。该数据集的发布为移动GUI智能体的零样本泛化能力提供了权威基准,推动了该领域从模拟训练到真实场景应用的过渡。
当前挑战
该数据集主要面临三大挑战:首先,移动GUI智能体需要解决从模拟环境到真实应用场景的泛化难题,这要求模型能够适应不同布局、分辨率及应用生态的差异。其次,评估任务设计需兼顾复杂性与可重复性,例如区分仅“到达目标页面”与“成功终止”两类行为的差异,数据集为此引入了reach-vs-terminate的诊断分析工具。最后,构建过程中遇到的挑战包括确保评估环境与训练集的完全独立性,避免任何潜在的边缘泄露,以及为不同模型(如Qwen2.5与Qwen3)提供灵活的坐标系统适配方案,这增加了数据集维护的复杂性。
常用场景
经典使用场景
在移动图形用户界面(GUI)智能体的研究领域中,appgen-eval-assets数据集被广泛用作评估智能体在未见环境下的泛化能力的标准基准。该数据集包含40个与训练池完全不相交的评估环境及194项任务,覆盖10个应用类别,路径长度从4到20步不等,为测试智能体在复杂导航任务中的表现提供了具有挑战性的测试平台。研究者通常利用其提供的评估框架(assets_eval_appgen.py)和预设提示模板,系统性地衡量智能体到达目标页面并正确发出终止信号的成功率,从而准确评估模型在真实移动操作场景中的综合性能。
解决学术问题
该数据集专门用于解决移动GUI智能体评估中普遍存在的过拟合与泛化能力不足的学术难题。传统上,在模拟器上训练的模型容易依赖训练环境中特定的视觉和结构模式,导致其在未见过的应用界面中表现急剧下降。通过提供严格分离的留出环境集合,appgen-eval-assets使研究者能够量化模型的零样本迁移能力,并诊断其是否真正掌握了通用的页面导航策略,而非简单的记忆匹配。这一机制促进了对于智能体鲁棒性和可迁移性的深入探讨,推动了更有效的训练方法和架构设计的出现。
实际应用
在实际部署场景中,来自appgen-eval-assets的评估结果直接指导移动智能体助手产品的研发与优化。例如,基于该基准评测的智能体可以被集成到手机操作系统或第三方应用中,执行用户下达的跨应用操作指令,如自动完成订餐、设置日程或修改系统设置等任务。其提供的按任务路径长度和类别拆分的性能指标,帮助开发者精准定位模型在长序列指令或特定类型应用上的短板,进而调整模型结构或训练策略。此外,通过对比 grounding_qwen3 等基准测试结果,研发团队可以验证新模型相对于已有方案的实质性进步。
数据集最近研究
最新研究方向
该数据集聚焦于移动端GUI智能体在仿真环境中的泛化能力评估,其核心价值在于为前沿的移动端自动化代理研究提供严格且可复现的评测基准。近期研究热点集中于如何让智能体在面对与训练数据完全解耦的新型应用环境时,仍能精准完成跨页面导航与任务终止指令。该数据集通过包含多个类别、路径长度各异的40个独立环境与194个任务,系统性地检验智能体的零样本迁移与鲁棒性,尤其关注“到达目标页面”与“终止信号”的协调机制。其诊断工具与探测脚本进一步推动了智能体在复杂界面中的行为透明度研究,对于构建更可靠、可解释的移动端自主操作代理具有重大意义,是当前GUI智能体领域不可或缺的评测资产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务