遇见数据集

browser-agent-tasks

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

本数据集包含中等难度、多步骤的浏览器任务,用于收集浏览器代理的执行轨迹,并评估截图、DOM 及 DOM 差异证据。数据以 JSONL 格式存储,每个任务定义包含以下字段:任务唯一标识符(task_id)、任务类别(category)、完整的操作指令(instruction)、建议的起始公开网页(start_url)、停止条件(stopping_condition)以及安全与范围约束(constraints)。所有任务均限定在公开浏览范围内,禁止代理执行登录、购买、提交不可逆表单或启动导航等操作。未来轨迹导出应保留有序动作、每次有意义动作后的观察、最终答案以及最终浏览器状态。

This dataset contains medium-difficulty, multi-step browser tasks for collecting execution traces of browser agents and evaluating evidence from screenshots, DOM, and DOM differences. Data is stored in JSONL format, with each task definition containing the following fields: task identifier (task_id), task category (category), complete instruction (instruction), suggested starting public web page (start_url), stopping condition (stopping_condition), and security and scope constraints (constraints). All tasks are limited to public browsing, prohibiting agents from performing login, purchase, submitting irreversible forms, or initiating navigation. Future trajectory exports should preserve ordered actions, observations after each meaningful action, final answer, and final browser state.

创建时间:
2026-08-07
原始信息汇总

数据集概述

Browser Agent Tasks 是一个用于浏览器代理任务的数据集,包含中等复杂度、多步骤的浏览器操作任务,旨在收集代理的轨迹数据,并用于评估基于截图、DOM 和 DOM 差异(DOM-diff)的证据。

文件结构

  • tasks.jsonl:每行包含一个任务定义。

任务字段说明

每个任务包含以下字段:

字段名 说明
task_id 稳定标识符
category 任务所属的类别
instruction 提供给浏览器代理的完整指令
start_url 建议的公开起始页面
stopping_condition 代理必须停止的条件
constraints 安全与范围限制

任务设计原则

  • 任务仅用于公开浏览,代理不得进行登录、购买、提交不可逆表单或启动导航等操作。
  • 未来的轨迹导出应保留:有序操作记录、每个有意义操作后的一个观测结果、最终答案以及最终浏览器状态。
搜集汇总
数据集介绍
browser-agent-tasks 数据集图片
构建方式
该数据集以结构化的JSONL格式精心编纂,每行一条任务定义,涵盖了任务标识符、所属类别、完整指令、建议起始URL、终止条件及安全约束等核心字段。任务设计聚焦于中等难度的多步骤浏览器操作,旨在模拟真实浏览场景,同时明确限定于公开网页浏览范畴,禁止涉及登录、购买、不可逆表单提交及导航启动等高风险行为。
使用方法
使用者可依据start_url启动浏览代理,遵循instruction执行操作,并借助stopping_condition判定任务完成界限。输出轨迹应有序保留每次动作后的观察结果、最终答案及浏览器终态,以支持后续的轨迹建模与策略优化。该数据集可直接用于浏览器自动化代理的训练、评估及多模态证据的对比研究,其公开浏览限制也保障了实验的可重复性与合规性。
背景与挑战
背景概述
随着大型语言模型与多模态感知技术的深度融合,自主浏览器代理(browser agent)逐渐成为人工智能领域的研究热点,其旨在模拟人类浏览行为以完成复杂网络任务。在此背景下,browser-agent-tasks数据集应运而生,由专注于智能体行为建模的研究团队构建,旨在为浏览器代理提供中等难度、多步骤的基准测试环境。该数据集于近年来发布,核心研究问题聚焦于代理在多步骤任务中的规划、执行与决策能力,同时涵盖对截图、文档对象模型(DOM)及DOM差异等证据类型的评估。通过系统化的任务定义与严格的约束条件,该数据集填补了现有基准在任务复杂性与证据多样性方面的空白,对推动自主浏览器代理的标准化评估与可复现研究具有重要影响力,成为该领域研究者验证算法性能的关键资源。
当前挑战
该数据集所面临的挑战根植于浏览器代理领域的固有难题。领域层面,核心挑战在于多步骤任务的复杂性与不确定性,代理需在动态网页环境中进行长期规划与决策,同时处理信息过载与噪声干扰,确保动作序列的合理性与安全性。构建层面,任务设计需兼顾难度的适中性(中等)与覆盖的广泛性,确保指令清晰且不引入歧义,同时严格遵循公共浏览限制,规避登录、支付等敏感操作,这要求对每项任务进行精细约束与审核。此外,未来轨迹数据的收集与导出亦面临挑战,需在保留完整动作序列、每步观测、最终答案及浏览器状态的同时,确保数据格式的标准化与可扩展性,以支持多证据类型的对比分析,这无疑增加了数据集构建与维护的复杂度。
常用场景
经典使用场景
在自主智能体与交互式网页环境交叉融合的研究前沿,Browser Agent Tasks数据集作为一项奠基性资源,专为多步骤浏览器任务而精心构筑。其核心用途在于为智能体轨迹的采集与多模态证据的评估提供标准化基准,覆盖截图、DOM结构及DOM差异等关键信息。研究者依托该数据集,能够系统性地训练与验证各类基于强化学习或模仿学习的浏览器操作模型,推动自主网页导航、信息检索与表单处理等任务的算法革新。
解决学术问题
该数据集精准回应当前大语言模型驱动的智能体在复杂网页环境中泛化能力不足、可解释性欠缺等核心学术挑战。通过提供包含明确指令、起点URL、停止条件与约束规范的多元化任务集合,它有效解决了智能体行为评估中缺乏统一尺度和可复现性问题。其研究意义在于,为比较不同架构(如纯文本模型与多模态模型)在真实网页操作中的效能提供了可控实验场,从而揭示智能体对动态DOM变化的适应机制,促进关于计划、决策与错误恢复等认知能力的理论深化。
实际应用
在实际应用维度,Browser Agent Tasks数据集的场景延伸至自动化网页测试、智能客户服务、在线信息聚合与无障碍浏览辅助等关键领域。借助该数据集训练的智能体,能够自主执行如查找特定商品价格、比较不同航班信息、填写非交易性表单等日常浏览器操作,显著提升办公自动化程度。此外,其约束设计保障了应用过程的安全性,使技术可安全落地于公共网页环境,为构建兼顾效率与合规的下一代数字助手提供了坚实的数据支撑与验证平台。
数据集最近研究
最新研究方向
当前,浏览器智能体任务数据集领域正聚焦于构建中度复杂、多步骤的交互式基准,以推动自主代理在真实网络环境中的能力评估与路径追踪。本数据集顺应此趋势,精心设计了涵盖多种任务族的定义集,每一任务均配备明确的起始URL、停止条件及安全约束,凸显了在开放网络中进行无登录、无交易、无不可逆操作的安全浏览原则。其未来规划中,有序操作轨迹与多模态证据(截图、DOM及DOM差异)的导出,预示着研究将迈向对代理决策过程的可解释性分析,这对于强化学习训练中奖励塑形和安全对齐具有重要意义。该数据集的发布,为评估代理在动态网页上的规划与适应性提供了标准化测试场,有望推动通用型浏览器智能体的落地,并促进人机交互界面的智能化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务