遇见数据集

WebHarbor

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

WebHarbor数据集是一个用于存储WebHarbor环境套件中重型静态资源的仓库。WebHarbor项目旨在对接真实网站,为GUI智能体环境提供演进支持。数据集包含多个网站的资源,每个网站对应一个gzip压缩的tar归档文件(.tar.gz)。解压后,每个站点包还原代码仓库中`sites/<site>/`目录下的内容,主要包括:作为控制平面每次重置(/reset)时恢复的SQLite源数据文件(`instance_seed/<site>.db`)、静态图像文件夹(`static/images/`)以及可选的静态外部缓存文件夹(`static/external_cache/`)。数据集的使用与WebHarbor代码仓库紧密绑定,通过仓库提供的脚本(如`fetch_assets.sh`)可以自动下载并提取全部或指定站点的资源。数据集的资产版本通过代码仓库中的`.assets-revision`文件进行锁定,确保了代码提交与特定资产版本的可复现性。该数据集适用于构建和测试基于真实网站的GUI智能体环境,为智能体与网页交互的模拟或测试提供底层数据支持。

The WebHarbor dataset is a repository for storing heavy static resources within the WebHarbor environment suite. WebHarbor is a project designed to interface with real websites, providing evolutionary support for GUI agent environments. The dataset contains resources for multiple websites, each corresponding to a gzip-compressed tar archive file (.tar.gz). After extraction, each site package restores the contents under the `sites/<site>/` directory in the code repository, primarily including: a SQLite source data file (`instance_seed/<site>.db`) that is restored during each reset (/reset) of the control plane, a static images folder (`static/images/`), and an optional static external cache folder (`static/external_cache/`). The usage of the dataset is tightly coupled with the WebHarbor code repository, where scripts (such as `fetch_assets.sh`) can automatically download and extract resources for all or specified sites. The asset version of the dataset is locked via the `.assets-revision` file in the code repository, ensuring reproducibility of code commits with specific asset versions. This dataset is suitable for building and testing GUI agent environments based on real websites, providing underlying data support for simulating or testing agent interactions with web pages.

创建时间:
2026-05-27
原始信息汇总

数据集名称

WebHarbor(⚓)

数据集简介

WebHarbor 是一个用于演化 GUI 代理环境的数据集,致力于为真实网站的 GUI 代理环境提供一个标准化的“停靠”平台。

数据集内容

  • 数据集托管了 WebHarbor 环境套件的重型静态资源。
  • 每个站点以单个 gzip 压缩的 tarball (.tar.gz) 存储。
  • 每个 tarball 包含:
    • instance_seed/<site>.db:SQLite 源数据文件,控制平面在每个 /reset 时恢复。
    • static/images/:站点的静态图片资源。
    • static/external_cache/:外部缓存资源(如适用)。

使用方式

  • 通过 WebHarbor 代码仓库中的 scripts/fetch_assets.sh 脚本自动下载并解压站点资源。
  • 支持下载所有站点或单个站点(例如 google_search)。
  • 资产版本与代码仓库的 .assets-revision 文件绑定,确保可复现性。

贡献

欢迎贡献新站点或更新现有站点,详情请查看 贡献指南

相关资源

资源 链接
🏠 WebHarbor 项目主页 WebHarbor
🤗 HuggingFace 数据集 ChilleD/WebHarbor
💻 WebHarbor GitHub 代码仓库
📊 贡献追踪表 Google Sheet
📝 贡献请求表单 Google Form

引用

WebHarbor 由北卡罗来纳大学教堂山分校和微软发起,并得到更广泛社区的贡献。联系方式:webharborcomm at gmail dot comzhaoyang at cs dot unc dot edu

bibtex @misc{webharbor2026, title = {WebHarbor: Docking Real Websites for Evolving GUI Agent Environments}, author = {{WebHarbor Team and Contributors}}, year = {2026}, url = {https://aiming-lab.github.io/webharbor.github.io}, note = {Project website.} }

搜集汇总
数据集介绍
WebHarbor 数据集图片
构建方式
WebHarbor数据集以站点为单位,为每个目标网站构建一个gzip压缩的tar包,其中包含SQLite数据库(instance_seed/<site>.db)作为控制平面在每次重置时恢复的状态来源,以及静态资源文件夹(static/images/)和可选的external_cache/目录。这些资产包与代码仓库中的提交版本绑定,通过.assets-revision文件锁定版本,确保代码与资产的可复现性。用户可通过fetch_assets.sh脚本自动化地下载并解压至sites/<site>/目录,从而快速恢复完整的网站环境。
特点
该数据集的核心特点在于其为GUI代理环境提供静态资产托管,通过精细的版本控制机制保障了数据的一致性与可复现性。每个站点独立打包,便于选择性部署与更新。WebHarbor不仅支持现有网站的资产恢复,还欢迎社区贡献新站点或更新现有站点,借助Contribution Track Sheet和Request Form实现协作管理。数据集的资产与代码仓库紧密耦合,一份提交对应特定资产版本,有效应对网页动态变化对代理训练带来的挑战。
使用方法
使用WebHarbor数据集时,用户首先克隆代码仓库(https://github.com/aiming-lab/WebHarbor),然后运行scripts/fetch_assets.sh脚本自动下载并解压所有站点的资产包,或指定单个站点名称实现选择性下载。脚本执行后,资产将按站点整理至sites/<site>/目录。最后,执行scripts/build.sh构建Docker镜像(webharbor:dev),获得完整的、可随时重置的GUI代理交互环境。整个流程自动化且版本可追溯。
背景与挑战
背景概述
WebHarbor数据集由北卡罗来纳大学教堂山分校与微软联合发起,于2026年创建,旨在为图形用户界面(GUI)智能体研究提供持续演化的真实网站环境。随着自动化Web交互任务的日益复杂,现有模拟环境多采用静态或人工构造的网页,无法有效反映真实互联网的动态性与多样性。WebHarbor通过锚定真实网站的快照并支持版本化更新,解决了GUI智能体训练与评估中环境真实度不足的核心问题。该数据集涵盖了多种类型网站的结构化资产、SQLite数据库及静态资源,为研究者提供了可复现的实验平台,在智能体、Web自动化及人机交互领域具有重要影响力。
当前挑战
WebHarbor所应对的领域挑战主要在于GUI智能体的泛化能力不足:真实网页结构频繁变动,而传统环境无法模拟这种动态性,导致模型在部署时性能骤降。构建过程中面临的核心挑战包括:如何高效抓取并持久化大规模真实网站的完整资源,同时确保不同版本间的可复现性;如何在保持网站交互逻辑完整性的前提下,将其封装为轻量级Docker环境以便快速重置;以及如何设计开放的贡献机制,鼓励社区持续更新站点资产以反映互联网真实演化进程,避免数据集随时间流逝而失效。
常用场景
经典使用场景
WebHarbor数据集的核心价值在于为图形用户界面(GUI)智能体研究提供了一个可复现、可演进的真实网站仿真环境。其经典使用场景是作为GUI智能体训练与评估的标准化试验场,研究者可在此环境上部署基于大语言模型或视觉语言模型的智能体,使其执行诸如网页导航、表单填写、信息检索等复杂交互任务。通过将真实网站的静态资产压缩打包并以版本化方式管理,WebHarbor确保了每次实验的环境一致性,从而支撑了跨时间、跨团队的公平对比研究。这一设计使得研究者能够像在真实互联网中一样测试智能体的鲁棒性与泛化能力,同时避免了在线环境的不确定性带来的实验噪声。
实际应用
在产业应用中,WebHarbor环境展现出多重实际价值。首先,它可作为网页自动化测试的沙盒,帮助开发团队在离线环境中验证智能体代理的交互稳定性与异常处理能力,降低线上部署风险。其次,该数据集支持企业定制化智能体训练,例如为电商、金融或政务服务领域构建能完成复杂操作流程的虚拟助手。此外,WebHarbor的版本化管理机制使其能够模拟网站迭代更新,成为持续集成与持续交付(CI/CD)管线中评估智能体适应性的组成部分。这些应用场景共同证明了WebHarbor从研究工具向工业落地桥梁转化的巨大潜力。
衍生相关工作
围绕WebHarbor数据集,学界涌现了一系列具有启发性的后续工作。其中,研究者们基于其稳定的环境基准,深入探索了智能体在长链任务中的规划与记忆机制,催生了诸如‘WebAgent Plan-and-Execute’等新型架构。同时,部分工作利用WebHarbor构建了多任务迁移学习基准,系统评估了预训练模型在不同网站间的零样本泛化能力。还有研究团队借助其贡献框架,扩展了面向动态内容的模拟环境,形成了WebHarbor-Banking、WebHarbor-Social等专业子集。这些衍生工作不仅验证了原数据集的设计理念,更推动了GUI智能体领域从单场景评测向跨领域自适应研究的重要跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务