遇见数据集

dev_set_v2_a1_mind2web_20260820_135120

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是一个多轮对话数据集,包含5786个训练样本。每条样本包含对话历史(conversations字段,由角色和内容组成)、使用的模型名称及提供商(model, model_provider)、任务名称(task)、运行期次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集的字段结构表明它可能用于记录、分析或评估不同模型在特定任务上的对话表现,适用于对话系统训练、模型行为分析或强化学习中的轨迹记录。

This dataset is a multi-turn conversation dataset containing 5,786 training samples. Each sample includes conversation history (conversations field, composed of role and content), model name and provider (model, model_provider), task name (task), episode, run ID (run_id), trial name (trial_name), result, verifier output (verifier_output), and trace source (trace_source). The field structure indicates that it may be used for recording, analyzing, or evaluating the dialogue performance of different models on specific tasks, suitable for dialogue system training, model behavior analysis, or trajectory recording in reinforcement learning.

提供机构:
LAION eV
创建时间:
2026-08-22
原始信息汇总

数据集概述

该数据集是由 LAION 组织发布的一个用于网页智能体(Web Agent)训练和评估的对话数据集,版本标识为 dev_set_v2_a1_mind2web_20260820_135120

数据规模

  • 总样本数:5,786 条(训练集)
  • 数据集总大小:约 530 MB(555,829,443 字节)
  • 下载大小:约 474 MB(497,081,385 字节)

数据特征字段

每条样本包含以下字段:

字段名 类型 说明
conversations 列表 对话轮次,每轮包含 role(角色)和 content(内容)两个子字段,均为字符串
agent 字符串 智能体名称或标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 任务执行结果
verifier_output 字符串 验证器输出结果
trace_source 字符串 轨迹来源

数据划分

  • 仅包含一个划分train,包含全部 5,786 条样本。

数据用途

该数据集面向基于 Mind2Web 基准的网页操作智能体任务,包含了多轮对话、任务执行记录及验证结果,适用于训练模型在真实网页环境中进行任务规划、操作和结果验证的研究。

搜集汇总
数据集介绍
dev_set_v2_a1_mind2web_20260820_135120 数据集图片
构建方式
在智能体(Agent)与网页交互研究领域,构建能够忠实记录决策轨迹与执行反馈的评测数据集,是推动自动化网页操作技术发展的关键环节。该数据集以Mind2Web任务为背景,通过采集多个智能体在真实或模拟网页环境中的完整对话轨迹而成。每一条样本均包含智能体与用户或环境之间的多轮对话记录,并同步标注了智能体名称、底层模型及其提供方、任务标识、执行轮次、试验名称以及运行标识等元信息。所有轨迹均由自动化流程统一记录,并辅以验证器输出与结果字段,从而形成从任务下发、动作执行到结果判定的闭环数据。
特点
该数据集在结构与内容上呈现出显著的多元性与可追溯性。对话内容以角色和文本构成的列表形式存储,完整保留了交互过程中的上下文信息,便于研究者还原智能体的推理与行动路径。数据集中同时涵盖多个智能体、多种模型及其提供方,为跨模型、跨策略的横向比较提供了条件。任务、轮次、试验与运行标识等字段的引入,使得同一条轨迹能够在不同粒度上被检索与聚合。数据集规模达五千余条样本,整体体量较大,能够支撑统计分析与模型评估等多种研究需求。
使用方法
研究者可通过标准数据加载接口读取该数据集,并依据字段结构对对话轨迹进行解析与筛选。在具体使用中,可基于agent、model、task等字段划分实验组,比较不同智能体或模型在相同任务上的表现;亦可利用result与verifier_output字段评估任务完成情况,或借助run_id与trial_name追踪同一试验的多次运行。对话字段可直接用于训练或微调面向网页操作的智能体模型,而元信息字段则适合用于构建检索、聚类或偏差分析流程。使用时建议结合具体研究问题选择相应子集,并注意数据划分仅包含训练集这一事实。
背景与挑战
背景概述
该数据集聚焦于基于网页环境的智能体任务自动评测与多轮交互轨迹记录,创建于2026年,与Mind2Web等网页智能体研究脉络相呼应。其核心研究问题在于如何系统化地评估语言模型驱动的智能体在真实或半真实网页任务中的决策能力、执行准确性与鲁棒性。数据集汇集了多种模型、提供商与任务类型下的对话轨迹、验证器输出及运行标识,为智能体行为分析提供了细粒度结构化素材。对相关领域而言,其价值在于推动网页智能体基准测试的标准化与可复现性。
当前挑战
该数据集所面对的领域挑战在于网页智能体任务本身的开放性与动态性:真实网页的界面变化、任务语义歧义、多步操作的长程依赖以及验证标准的多样性,均对智能体评测构成严峻考验。构建过程中,如何统一不同模型与执行环境的对话记录格式、确保验证器输出的一致性与可解释性、平衡任务覆盖度与数据规模、以及避免轨迹采集中的偏差与噪声,均为关键难点。此外,将多来源轨迹整合为可供训练与评估的标准化结构,也需要在数据清洗、对齐与质量校验环节投入大量工程努力。
常用场景
经典使用场景
在智能体与网页交互研究领域,该数据集承载着多轮对话轨迹与任务执行结果的细粒度记录,其最经典的使用场景在于训练和评估基于语言模型的网页导航智能体。研究者利用其中结构化的conversations字段还原智能体逐步操作浏览器的决策序列,并借助task与result标签对任务完成质量进行自动验证,从而构建端到端的交互式学习闭环。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,包括基于思维链的网页操作策略蒸馏、多智能体协同导航框架以及面向鲁棒性的对抗性轨迹增强方法。这些工作依托其完整的交互记录与验证反馈,在动作预测、状态追踪和跨网站泛化等方向形成了可比较的基线,持续拓展着网页智能体研究的边界。
数据集最近研究
最新研究方向
在智能体与网页交互研究领域,该数据集聚焦于基于Mind2Web基准的动态环境下的多轮对话决策轨迹分析,近期研究致力于探索大语言模型智能体在复杂网页导航任务中的泛化能力。通过整合模型提供者、任务类型及验证器输出等多维标注,该数据集支撑了对智能体行为可解释性与错误恢复机制的深入探究。当前热点在于利用此类细粒度轨迹数据评估不同模型在真实网页场景中的鲁棒性,并推动自动化验证与自我修正策略的发展,为构建可信赖的通用网页智能体提供了关键实证基础与评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务