遇见数据集

magicgh/MT-Mind2Web

收藏
Hugging Face2024-02-23 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-4.0 language: - en pretty_name: MT-Mind2Web tags: - web navigation - conversation --- # MT-Mind2Web Dataset MT-Mind2Web is constructed by using the single-turn interactions from [Mind2Web](https://huggingface.co/datasets/osunlp/Mind2Web), an expert-annotated web navigation dataset, as the guidance to construct conversation sessions. ## Statistics | | Train | Test-Task | Test-Website | Test-Subdomain | |--------------------|-------|-----------|--------------|----------------| | # Conversations | 600 | 34 | 42 | 44 | | # Turns | 2,896 | 191 | 218 | 216 | | Avg. # Turn/Conv. | 4.83 | 5.62 | 5.19 | 4.91 | | Avg. # Action/Turn | 2.95 | 3.16 | 3.01 | 3.07 | | Avg. # Element/Turn| 573.8 | 626.3 | 620.6 | 759.4 | | Avg. Inst. Length | 36.3 | 37.4 | 39.8 | 36.2 | | Avg. HTML Length | 169K | 195K | 138K | 397K | ## Dataset Structure - "task_id" (str): unique id for each task - "website" (str): website name - "domain" (str): website domain - "subdomain" (str): website subdomain - "turns" (list[dict]): list of subtasks - "annotation_id" (str): unique id for each subtask - "confirmed_task" (str): subtask description - "action_reprs" (list[str]): human readable string representation of the action sequence - "actions" (list[dict]): list of actions (steps) to complete the subtask - "action_uid" (str): unique id for each action (step) - "raw_html" (str): raw html of the page before the action is performed - "cleaned_html" (str): cleaned html of the page before the action is performed - "operation" (dict): operation to perform - "op" (str): operation type, one of CLICK, TYPE, SELECT - "original_op" (str): original operation type, contain additional HOVER and ENTER that are mapped to CLICK, not used - "value" (str): optional value for the operation, e.g., text to type, option to select - "pos_candidates" (list[dict]): ground truth elements. Here we only include positive elements that exist in "cleaned_html" after our preprocessing, so "pos_candidates" might be empty. The original labeled element can always be found in the "raw_html". - "tag" (str): tag of the element - "is_original_target" (bool): whether the element is the original target labeled by the annotator - "is_top_level_target" (bool): whether the element is a top level target find by our algorithm. please see the paper for more details. - "backend_node_id" (str): unique id for the element - "attributes" (str): serialized attributes of the element, use `json.loads` to convert back to dict - "neg_candidates" (list[dict]): other candidate elements in the page after preprocessing, has similar structure as "pos_candidates"

许可证:CC BY 4.0 语言:英语 数据集名称:MT-Mind2Web 标签:网页导航、对话 # MT-Mind2Web 数据集 MT-Mind2Web 数据集以专家标注的网页导航数据集[Mind2Web](https://huggingface.co/datasets/osunlp/Mind2Web)中的单轮交互作为指导,构建对话会话。 ## 统计信息 | 统计项 | 训练集 | 测试-任务集 | 测试-网站集 | 测试-子域集 | |----------------------|--------|-------------|-------------|-------------| | 对话总数 | 600 | 34 | 42 | 44 | | 总轮次 | 2,896 | 191 | 218 | 216 | | 平均单对话轮数 | 4.83 | 5.62 | 5.19 | 4.91 | | 平均每轮动作数 | 2.95 | 3.16 | 3.01 | 3.07 | | 平均每轮页面元素数 | 573.8 | 626.3 | 620.6 | 759.4 | | 平均指令长度 | 36.3 | 37.4 | 39.8 | 36.2 | | 平均HTML长度 | 169K | 195K | 138K | 397K | ## 数据集结构 - `task_id`(字符串):每个任务的唯一标识符 - `website`(字符串):网站名称 - `domain`(字符串):网站域名 - `subdomain`(字符串):网站子域名 - `turns`(字典列表):子任务列表 - `annotation_id`(字符串):每个子任务的唯一标识符 - `confirmed_task`(字符串):子任务描述 - `action_reprs`(字符串列表):动作序列的人类可读字符串表示 - `actions`(字典列表):完成子任务的动作(步骤)列表 - `action_uid`(字符串):每个动作(步骤)的唯一标识符 - `raw_html`(字符串):执行动作前的页面原始HTML代码 - `cleaned_html`(字符串):执行动作前的页面清洗后HTML代码 - `operation`(字典):待执行的操作 - `op`(字符串):操作类型,可选值为CLICK、TYPE、SELECT - `original_op`(字符串):原始操作类型,包含额外的HOVER和ENTER(已映射至CLICK,未实际使用) - `value`(字符串):操作的可选参数,例如待输入的文本、待选择的选项 - `pos_candidates`(字典列表):真实标注元素。此处仅包含预处理后仍存在于`cleaned_html`中的正样本元素,因此`pos_candidates`可能为空。原始标注元素始终可在`raw_html`中找到。 - `tag`(字符串):元素的标签 - `is_original_target`(布尔值):该元素是否为标注者标注的原始目标 - `is_top_level_target`(布尔值):该元素是否为算法识别的顶级目标,详细说明请参考相关论文 - `backend_node_id`(字符串):元素的唯一标识符 - `attributes`(字符串):元素的序列化属性,可使用`json.loads`转换为字典格式 - `neg_candidates`(字典列表):预处理后页面中的其他候选元素,结构与`pos_candidates`类似

提供机构:
magicgh
原始信息汇总

MT-Mind2Web 数据集

MT-Mind2Web 数据集是通过使用 Mind2Web 的单轮交互作为指导,构建对话会话而建立的。Mind2Web 是一个专家注释的网页导航数据集。

统计信息

训练集 测试-任务 测试-网站 测试-子域
# 对话数 600 34 42 44
# 轮数 2,896 191 218 216
平均轮数/对话 4.83 5.62 5.19 4.91
平均动作数/轮 2.95 3.16 3.01 3.07
平均元素数/轮 573.8 626.3 620.6 759.4
平均指令长度 36.3 37.4 39.8 36.2
平均HTML长度 169K 195K 138K 397K

数据集结构

  • "task_id" (str): 每个任务的唯一ID
  • "website" (str): 网站名称
  • "domain" (str): 网站域名
  • "subdomain" (str): 网站子域名
  • "turns" (list[dict]): 子任务列表
    • "annotation_id" (str): 每个子任务的唯一ID
    • "confirmed_task" (str): 子任务描述
    • "action_reprs" (list[str]): 动作序列的人类可读字符串表示
    • "actions" (list[dict]): 完成子任务的动作(步骤)列表
      • "action_uid" (str): 每个动作(步骤)的唯一ID
      • "raw_html" (str): 执行动作前的原始HTML
      • "cleaned_html" (str): 执行动作前的清理后的HTML
      • "operation" (dict): 要执行的操作
        • "op" (str): 操作类型,包括 CLICK, TYPE, SELECT
        • "original_op" (str): 原始操作类型,包含额外的 HOVER 和 ENTER,映射到 CLICK,未使用
        • "value" (str): 操作的可选值,例如要输入的文本,要选择的选项
      • "pos_candidates" (list[dict]): 地面真实元素。这里只包括预处理后存在于 "cleaned_html" 中的正元素,因此 "pos_candidates" 可能为空。原始标记的元素始终可以在 "raw_html" 中找到。
        • "tag" (str): 元素的标签
        • "is_original_target" (bool): 元素是否为注释者标记的原始目标
        • "is_top_level_target" (bool): 元素是否为我们的算法找到的顶级目标。详情请参见论文。
        • "backend_node_id" (str): 元素的唯一ID
        • "attributes" (str): 元素的序列化属性,使用 json.loads 转换回字典
      • "neg_candidates" (list[dict]): 预处理后页面中的其他候选元素,具有与 "pos_candidates" 类似的结构
搜集汇总
数据集介绍
magicgh/MT-Mind2Web 数据集图片
构建方式
MT-Mind2Web数据集基于专家标注的网页导航数据集Mind2Web构建而成。研究者巧妙地将原始数据中的单轮交互作为指导,通过整合与重组,构建出多轮对话会话。这一过程保留了原始数据的高质量标注,同时赋予了数据集对话式的交互结构,使其能够模拟真实场景下用户与网页的连续交互行为。
特点
该数据集包含600个训练会话及多个测试子集,平均每个会话包含约4.83轮交互,每轮平均包含2.95个操作步骤。每个交互步骤均提供原始与清洗后的HTML页面快照、操作类型(点击、输入、选择)及正负候选元素标注。数据集覆盖多种网站、领域和子域,HTML长度跨度大,为模型提供了丰富的网页导航上下文。
使用方法
数据集适用于多轮网页导航任务的训练与评估。研究者可利用task_id、website等字段定位任务,通过turns列表中的confirmed_task获取子任务描述,结合operations与pos_candidates进行动作预测。建议将cleaned_html作为模型输入,利用action_reprs作为监督信号,训练模型在复杂HTML环境中完成连续操作序列的推理与执行。
背景与挑战
背景概述
MT-Mind2Web数据集由研究团队于近期构建,依托于专家标注的Mind2Web单轮交互数据,旨在推动多轮对话式网页导航任务的发展。该数据集由来自相关领域的研究人员主导,核心研究问题在于如何将单步操作指令转化为连贯的多轮对话序列,以模拟真实用户与复杂网页界面的交互过程。通过精心设计对话会话,MT-Mind2Web为评估智能体在多步骤网络导航中的规划与执行能力提供了标准化基准,对自动化网页任务处理、对话式人工智能助手等领域产生了重要影响,弥补了现有数据集在多轮交互建模方面的不足。
当前挑战
MT-Mind2Web面临的核心挑战源于多轮对话式网页导航的固有复杂性:首先,领域问题层面,智能体需在动态变化的HTML页面中准确理解长上下文指令(平均指令长度达36-40词),并处理平均每轮近600个候选元素的庞杂页面结构,这对模型的语义解析与注意力机制构成严峻考验;其次,构建过程中,将原始单轮操作序列转化为自然的多轮对话时,需平衡子任务划分的粒度与对话流畅性,避免因动作分解过细(平均每轮2.95-3.16个动作)导致交互冗余,同时确保跨轮次的状态依赖关系被完整保留,这对数据标注的连贯性与一致性提出了极高要求。
常用场景
经典使用场景
MT-Mind2Web数据集的核心经典使用场景在于构建并评估多轮对话式网页导航系统。该数据集将单步交互的Mind2Web数据巧妙地转化为多轮对话会话,使得研究者和开发者能够训练模型在复杂的网页环境中,依据连续的自然语言指令完成一系列有序的操作,如点击、输入文本和选择下拉选项。这一场景模拟了真实用户与网页的交互流程,为开发具备记忆和规划能力的对话式智能代理提供了标准化的训练与测试基准。
解决学术问题
该数据集有效解决了学术研究中网页导航任务从单步指令到多轮对话的跃迁难题。传统研究多聚焦于孤立动作的预测,而MT-Mind2Web通过构造包含平均近5轮对话的会话结构,推动了模型对上下文理解、子任务分解和长程依赖建模能力的探索。其贡献在于揭示了多步操作间的逻辑关联,为评估智能体在动态网页环境中的规划与适应能力提供了量化指标,显著提升了网页自动化领域研究的生态丰富度。
衍生相关工作
基于MT-Mind2Web,学术界已衍生出多项经典工作。研究者利用该数据集探索了基于大型语言模型(LLM)的端到端网页代理,如通过指令微调使LLM具备多轮对话中的动作预测能力。此外,该数据集促进了多模态网页理解研究,将视觉布局与HTML代码结合,提升了元素定位的鲁棒性。还有工作聚焦于将对话历史编码为状态表示,以增强智能体对已完成步骤的记忆,这些衍生研究共同推动了可交互网页智能体的发展前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务