遇见数据集

WikiHow任务集

收藏
arXiv2024-02-24 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

WikiHow任务集是基于WikiHow应用构建的,旨在评估大型语言模型(LLMs)在图形用户界面(GUI)交互中的能力。该数据集包含150个多阶段任务,涵盖了搜索、浏览、理解和管理等多种GUI操作能力。数据集通过爬取WikiHow应用中的107,448个页面和856,045个文本及多媒体资源创建,确保了评估的一致性。创建过程中,使用了任务定义模板和ChatGPT辅助重写指令,以增加表达的多样性。WikiHow任务集的应用领域主要集中在评估LLMs在复杂环境中的多轮交互能力,解决实际GUI交互中的挑战。

The WikiHow Task Set is built on the WikiHow application, designed to evaluate the capabilities of Large Language Models (LLMs) in graphical user interface (GUI) interactions. The dataset contains 150 multi-stage tasks, covering a variety of GUI operation capabilities including searching, browsing, comprehension and management. It is constructed by crawling 107,448 pages and 856,045 text and multimedia resources from the WikiHow application, which ensures the consistency of the evaluation. During the creation process, task definition templates and ChatGPT were used to assist in rewriting instructions to increase the diversity of expressions. The application scenarios of the WikiHow Task Set mainly focus on evaluating the multi-turn interaction capabilities of LLMs in complex environments and addressing challenges in practical GUI interactions.

创建时间:
2023-05-14
搜集汇总
数据集介绍
构建方式
WikiHow任务集构建于Mobile-Env平台之上,旨在评估大语言模型在图形用户界面交互中的能力。该数据集通过三个精心设计的阶段完成构建:首先,从WikiHow应用中爬取并本地化存储了107,448个页面及856,045项文本与多媒体资源,确保评估不受时空差异影响;其次,依据WikiHow中页面的功能角色与元素类型,设计了一套子任务定义模板,通过填充关键词槽位并串联形成多阶段任务定义;最后,借助ChatGPT对模板化指令进行改写,以增加表达的多样性与自然度,并在运行时动态替换指令。最终形成了涵盖跨页面导航、页面内操作及问答三种类型的150个多阶段任务,平均每个任务包含2.68个子阶段。
特点
该数据集具有显著的结构化与挑战性特征。任务分为跨页面任务、页面内任务与问答任务三类,分别考察智能体在页面间导航、页面内管理操作(如收藏、评分)以及对文章内容进行摘要或提取信息的能力。每个任务由一组顺序执行的子指令构成,每完成一条指令即获得奖励,仅当所有指令均成功执行时任务才算完成。数据集特别强调对理解能力与决策能力的综合评估,前者涵盖指令理解、界面元素功能推断及指令与屏幕的对齐,后者则涉及意图到动作的映射以及对环境反馈的响应。实验结果表明,即使最先进的GPT-4模型在该数据集上的成功率也仅为43.33%,凸显了其作为基准的严峻挑战性。
使用方法
使用WikiHow任务集时,研究者需基于Mobile-Env平台运行。智能体接收包含任务描述、当前屏幕表示(以标记文本或截图形式呈现)、当前指令及历史动作序列的输入,并输出一个思考过程与一个具体动作。动作空间支持CLICK、INPUT、SCROLL、ANSWER及GOBACK等元素级操作。对于文本型大语言模型,观察空间利用视图层级结构转换为简化的HTML元素列表;对于视觉语言模型,则采用原始截图或应用了Set-of-Mark标注的图像作为输入,并对应像素级或元素级动作空间。实验通常采用2-shot上下文学习,温度设为0.1,最大轨迹长度限制为15步。问答任务通过SentenceTransformer计算模型输出与标准答案的语义相似度,并以0.7为阈值判定成功与否。
背景与挑战
背景概述
在图形用户界面(GUI)交互领域,如何使大型语言模型(LLM)能够像人类一样在真实移动应用环境中执行多步骤任务,已成为人机交互研究的前沿课题。为此,上海交通大学X-LANCE实验室的张丹阳及其合作者于2024年提出了Mobile-Env评估平台,并基于WikiHow应用构建了WikiHow任务集。该数据集聚焦于评估LLM在移动GUI交互中的理解与决策能力,涵盖跨页面导航、页面内操作及问答三种任务类型,共150个多步骤任务。通过整合文本与视觉观察空间、原子与复合动作空间,WikiHow任务集为LLM驱动的自然语言界面研究提供了首个可扩展、高逼真度的基准测试,显著推动了该领域的发展。
当前挑战
WikiHow任务集面临的核心挑战在于LLM对真实GUI环境的适应能力。首先,任务要求模型具备多步骤规划与执行能力,而当前最优模型(如GPT-4)的成功率仅达43.33%,尤其在问答任务中表现不佳,原因在于模型需从混杂HTML结构的文章页面中提取信息并生成答案。其次,构建过程中需解决数据一致性难题,如通过爬取并本地化107,448个页面来消除时空差异,同时利用ChatGPT重写模板化指令以增加表达多样性。此外,视觉语言模型在像素级动作定位和抗干扰方面存在明显短板,而开源模型在指令遵循和格式输出上仍与商业模型存在显著差距。
常用场景
经典使用场景
在移动图形用户界面(GUI)交互领域,WikiHow任务集作为Mobile-Env平台的核心基准,广泛用于评估大语言模型(LLM)在多步、复杂GUI操作中的表现。该数据集基于真实安卓应用WikiHow构建,涵盖搜索、浏览、页面跳转、书签管理、评分及问答等多样化操作,要求智能体具备理解页面元素、对齐指令与屏幕、进行跨页导航和滚动阅读等综合能力。其经典使用场景是衡量LLM作为自然语言界面(NLI)在与真实移动应用交互时的任务完成成功率与平均奖励,尤其关注多步决策与反馈适应能力。
实际应用
在实际应用中,WikiHow任务集所评估的LLM-GUI交互能力可直接赋能智能助手、自动化测试和辅助生活工具的开发。例如,用户可以通过自然语言指令让智能体在WikiHow应用中查找食谱、提取配料清单、收藏文章或分享内容,从而替代繁琐的手动操作。该数据集验证了LLM在移动端执行多步骤任务(如“搜索文章→阅读→评分”)的可行性,为构建无需API、仅通过屏幕交互的通用型数字助理提供了技术验证平台。此外,其数据固定与回放机制确保了评估的可复现性,适用于工业级自动化测试场景。
衍生相关工作
WikiHow任务集及其依托的Mobile-Env平台催生了多项经典衍生工作。例如,AgentLM系列模型通过AgentTuning方法在该任务集上进行微调,显著提升了LLM在GUI交互中的格式遵循与决策连贯性;Set-of-Mark(SoM)提示策略被引入视觉语言模型(如GPT-4V)中,通过标记屏幕元素坐标大幅改善了动作定位精度。此外,该任务集启发了对多示例学习(few-shot ICL)中示例质量与数量影响的深入研究,以及针对长序列滚动操作中智能体“信念缺失”问题的探索。这些工作共同推动了LLM从静态理解向动态交互的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务