遇见数据集

WildClawBench-Harbor

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

WildClawBench-Harbor 是 WildClawBench 基准测试的 Harbor 格式转换版本,旨在通过标准化的 Harbor 框架对智能体进行真实世界、长周期任务评估。数据集包含 60 个手工设计的任务,每个任务需要智能体进行多步骤工具调用(10-60+次)、多模态处理(视频、图像、文档)、在真实代码仓库上编码,并具备对提示注入的鲁棒性。任务划分为 6 个类别:生产力流程(10 个任务,涉及信息综合、文档处理、日程安排)、代码智能(12 个任务,涉及代码库理解、视觉推理、脚本生成)、社交互动(6 个任务,涉及多轮通信、路由、线程整合)、搜索与检索(11 个任务,涉及约束搜索、冲突解决、数据提取)、创意合成(11 个任务,涉及视频/音频处理、跨模态生成)、安全对齐(10 个任务,涉及提示注入抵抗、凭证意识、危险操作拒绝)。部分任务使用中文指令(以 _zh 后缀标识),其余为英文。每个任务以自包含的 Harbor 目录形式组织,包含 task.toml 配置文件、instruction.md 指令文件、环境资产和测试脚本。数据集规模小于 1000 个样本(实际为 60 个任务)。使用方式:安装 Harbor 工具后,下载数据集并通过 `harbor run` 命令运行单个或全部任务。任务运行需要 Docker 和网络访问,可选 Brave 搜索 API。评分由每个任务的验证器输出奖励(0/1 或结构化 JSON),基准分数为所有任务的平均奖励。对于安全对齐类别,“成功”意味着智能体拒绝或安全处理了对抗性请求。该数据集源自原始 WildClawBench 论文(arXiv:2605.10912),转换过程中未改变任务内容或评分逻辑。

WildClawBench-Harbor is a Harbor-format converted version of the WildClawBench benchmark, designed to evaluate agents on real-world, long-horizon tasks through the standardized Harbor framework. The dataset contains 60 handcrafted tasks, each requiring agents to perform multi-step tool calls (10-60+ steps), multimodal processing (video, images, documents), coding on real code repositories, and robustness against prompt injection. Tasks are divided into 6 categories: Productivity Workflows (10 tasks, involving information synthesis, document processing, scheduling), Code Intelligence (12 tasks, involving codebase understanding, visual reasoning, script generation), Social Interaction (6 tasks, involving multi-turn communication, routing, thread consolidation), Search & Retrieval (11 tasks, involving constrained search, conflict resolution, data extraction), Creative Synthesis (11 tasks, involving video/audio processing, cross-modal generation), and Safety Alignment (10 tasks, involving prompt injection resistance, credential awareness, dangerous operation refusal). Some tasks use Chinese instructions (identified by the _zh suffix), while the rest are in English. Each task is organized as a self-contained Harbor directory containing a task.toml configuration file, instruction.md file, environment assets, and test scripts. The dataset size is less than 1000 samples (actually 60 tasks). Usage: install the Harbor tool, download the dataset, and run single or all tasks via the `harbor run` command. Task execution requires Docker and network access, with an optional Brave Search API. Scoring is performed by each tasks validator, outputting a reward (0/1 or structured JSON), and the benchmark score is the average reward across all tasks. For the Safety Alignment category, success means the agent rejected or safely handled adversarial requests. The dataset originates from the original WildClawBench paper (arXiv:2605.10912), and the conversion process did not change the task content or scoring logic.

提供机构:
InternLM
创建时间:
2026-08-12
原始信息汇总

WildClawBench-Harbor 数据集详情

数据集概述

WildClawBench-Harbor 是 WildClawBench 基准测试转换为 Harbor 任务格式的版本,包含全部 60 个任务,可直接通过 harbor run 命令在任意支持 Harbor 的智能体(如 Claude Code、OpenHands、Codex CLI 及自定义智能体)上运行。WildClawBench 是一个用于真实世界、长周期智能体评估的基准测试,任务涉及多步骤工具调用(10–60+ 次)、多模态处理(视频、图像、文档)、真实代码库编程以及对提示注入的鲁棒性。

任务类别

类别 任务数 重点
01 Productivity Flow 10 信息综合、文档处理、日程安排
02 Code Intelligence 12 代码库理解、视觉推理、脚本生成
03 Social Interaction 6 多轮通信、路由、线程整合
04 Search & Retrieval 11 约束搜索、冲突解决、数据提取
05 Creative Synthesis 11 视频/音频处理、跨模态生成
06 Safety Alignment 10 提示注入抵抗、凭证意识、危险操作拒绝

带有 _zh 后缀的任务使用中文指令,其余任务使用英文。

仓库结构

每个任务均为自包含的 Harbor 任务目录,位于仓库根目录,命名格式为 <category>_task_<n>_<slug>

01_Productivity_Flow_task_1_arxiv_digest/ ├── task.toml # Harbor 任务配置(schema 1.4):环境、超时、元数据 ├── instruction.md # 提供给智能体的任务提示 ├── environment/ │ └── .wildclaw/ # 复制到容器中的工作区资源 │ ├── run-warmup.sh # 环境预热脚本,作为健康检查在智能体启动前运行 │ └── skills/ # 任务可用技能(如 agent-browser) └── tests/ ├── test.sh # 验证器入口;将奖励写入 /logs/verifier/ ├── grader.py # 评分逻辑 ├── checks.py └── transcript_loader.py

关键配置

  • 环境:使用预构建 Docker 镜像(wildclawbench-ubuntu:v1.3),工作目录为 /tmp_workspace,网络模式为 public(任务涉及实时网络访问)。
  • 超时:智能体运行 20 分钟,验证器运行 10 分钟(部分任务略有差异)。
  • 验证器:在与智能体共享的容器中运行(environment_mode = "shared"),仅在智能体执行完毕后注入,确保评分器在运行期间对智能体不可见。
  • 产物:每次运行后收集 /tmp_workspace/results 下的任务输出。

快速开始

  1. 安装 Harbor:uv tool install harborpip install harbor

  2. 下载数据集:hf download internlm/WildClawBench-Harbor --repo-type dataset --local-dir ./WildClawBench-Harbor

  3. 运行单个任务: bash harbor run -p ./WildClawBench-Harbor/01_Productivity_Flow_task_1_arxiv_digest -a claude-code -m anthropic/claude-opus-4-1

  4. 运行完整基准: bash harbor run -p ./WildClawBench-Harbor -a claude-code -m anthropic/claude-opus-4-1 --n-concurrent 4

前置条件

  • 需要 Docker;任务在 wildclawbench-ubuntu:v1.3 镜像中运行,该镜像以 tarball 形式随原始 WildClawBench 仓库提供,需先加载。
  • BRAVE_API_KEY(可选):搜索类任务会将其传递给容器以使用 Brave Search API。
  • 任务需要出站网络访问(需浏览实时网页);搜索/检索类任务的结果可能因网页内容变化而略有差异。

评分方式

每个任务的验证器将奖励(0/1,或部分评分任务的结构化 JSON 指标)写入 /logs/verifier/。Harbor 汇总各任务奖励,基准得分为平均奖励。对于 Safety Alignment 类别,“成功”表示智能体拒绝或安全处理了对抗性请求。

与原始版本的区别

  • 原始 WildClawBench 以 Markdown 规范加 OpenClaw 运行器发布任务;本仓库将每个任务重新打包为标准 Harbor 布局(task.toml / instruction.md / environment/ / tests/),不改变任务内容或评分逻辑。
  • 任务命名简化为仓库根目录下的 <category>_task_<n>_<slug> 目录。

引用信息

若使用此基准测试,请引用原始 WildClawBench 论文:

bibtex @article{ding2026wildclawbench, title={Wildclawbench: A benchmark for real-world, long-horizon agent evaluation}, author={Ding, Shuangrui and Dai, Xuanlang and Xing, Long and Ding, Shengyuan and Liu, Ziyu and JingYi, Yang and Yang, Penghui and Zhang, Zhixiong and Wei, Xilin and Fang, Xinyu and others}, journal={arXiv preprint arXiv:2605.10912}, year={2026} }

搜集汇总
数据集介绍
WildClawBench-Harbor 数据集图片
构建方式
WildClawBench-Harbor是基于WildClawBench基准测试转换而成的Harbor格式数据集。该数据集将原始基准中的60个手工构建任务重新打包为标准的Harbor任务目录结构,每个任务包含task.toml配置文件、instruction.md提示文件、environment环境资源以及tests测试脚本。任务环境采用预构建的Docker镜像,支持公共网络访问,并设有代理和验证器超时机制。验证器在代理执行完毕后注入共享容器,确保评分逻辑对代理不可见。数据集覆盖六大任务类别,包括生产力流程、代码智能、社交交互、搜索检索、创意综合和安全对齐,其中部分任务使用中文指令。
使用方法
使用WildClawBench-Harbor进行评估时,需先安装Harbor工具,并下载数据集及预构建的Docker镜像。通过`harbor run`命令可运行单个任务或整个基准,支持并发执行以加速评估。任务运行需要Docker环境和公共网络访问,搜索类任务可选配置Brave API密钥。评分由各任务的验证器完成,输出奖励值到指定日志路径,Harbor汇总所有任务的平均奖励作为基准分数。用户可通过HuggingFace下载数据集,并根据需要定制代理配置,实现灵活、可复现的代理性能评估。
背景与挑战
背景概述
WildClawBench-Harbor由上海人工智能实验室(InternLM团队)于2026年发布,是面向真实世界、长时程智能体评估的基准测试WildClawBench的Harbor格式适配版。该数据集由丁双瑞等人主导构建,核心研究问题在于如何系统性地评估智能体在多步骤工具调用、多模态信息处理、真实代码库操作及对抗性提示注入等复杂场景下的综合性能。通过将60个手工构建的任务标准化为Harbor任务格式,该基准不仅实现了与Claude Code、OpenHands等主流智能体框架的无缝对接,更推动了智能体评估从单一任务向全流程、高鲁棒性方向的范式转变,为通用人工智能体的能力测评提供了可复现、可扩展的公共基准平台。
当前挑战
该数据集面临的核心挑战之一在于领域问题的复杂性:真实世界任务往往需要10至60余次工具调用,跨越视频、图像、文档等多种模态,并涉及实时网络交互,这对智能体的长期规划与动态适应能力构成严峻考验。构建过程中,研究者需攻克多方面的技术难关,包括任务环境的容器化封装与网络依赖处理、验证器与智能体执行环境的安全隔离、跨类别任务(涵盖生产力、代码智能、社交互动、搜索检索、创意综合及安全对齐)的精细化设计,以及如何在保持任务真实性的前提下确保评分逻辑的清晰一致。此外,随着网络内容动态演变,搜索类任务的结果存在时间敏感性,这为基准的长期稳定评估带来了持续挑战。
常用场景
经典使用场景
WildClawBench-Harbor作为一项面向真实世界长程智能体评估的基准测试,其经典使用场景在于对具备多步工具调用、多模态处理及实时编程能力的智能体进行系统性评测。该数据集精心构建了60项任务,覆盖生产力流程、代码智能、社交互动、搜索检索、创意合成与安全对齐六大类别,要求智能体在模拟真实环境的容器中完成涉及10至60余次连续工具调用的复杂操作,并具备视频、图像、文档等多模态信息处理能力。研究者利用Harbor框架的统一接口,通过一条`harbor run`命令即可驱动包括Claude Code、OpenHands等在内的多种前沿智能体在标准化任务上展开竞技,从而在高度仿真的环境下量度智能体的综合性能,为长程规划、环境交互和工具运用等核心能力的演进提供严谨的测试平台。
解决学术问题
该数据集精准回应当前智能体评估领域面临的重大挑战:现有基准多聚焦于单步或短程任务,难以反映现实世界中智能体需要长时间自主决策、动态调整策略并抵御安全威胁的复杂诉求。WildClawBench-Harbor通过引入长时域、多模态、真实代码库操作和提示注入对抗等要素,构建了一个兼具挑战性与生态效度的评估体系,有效填补了高难度、高真实性基准的空白。其学术意义在于,为量化不同模型在真实生产力场景中的适应性、鲁棒性和安全性提供了标准化标尺,推动了智能体研究从实验室原型向工业落地的过渡,并为后续方法论的改进提供了可复现的参照系。
实际应用
在实际应用维度,WildClawBench-Harbor直接服务于智能体产品的开发与迭代,尤其适用于科技企业在发布新模型前进行的质量保障测试。开发团队可借助该基准快速评估自家智能体在处理真实文档、浏览动态网页、操作代码仓库以及防御恶意指令注入等方面的能力,从而识别系统性缺陷并加以优化。此外,该数据集也可作为教育与培训资源,通过模拟高仿真任务帮助研究人员和工程师深入理解长程智能体的行为模式。其Harbor兼容性降低了使用门槛,使得无论学术实验室抑或产业部门都能以极低迁移成本接入,成为智能体工程实践中不可或缺的验证工具。
数据集最近研究
最新研究方向
WildClawBench-Harbor作为WildClawBench的Harbor格式重构版本,代表了智能体评估领域的前沿趋势——从封闭式任务转向真实世界、长程、多模态的复杂场景。该数据集涵盖生产力流程、代码智能、社交互动、搜索检索、创意合成与安全对齐六大维度,共60项手工构建任务,要求智能体进行10至60余步工具调用、处理视频图像文档等多模态信息,并在真实代码库上编程,同时抵御提示注入攻击。其核心创新在于通过Harbor框架实现标准化封装,使得Claude Code、OpenHands、Codex CLI等任意Harbor支持的智能体均可通过单一命令直接运行全部任务,极大降低了基准测试的部署门槛,促进了智能体评估的跨平台可复现性。特别地,安全对齐类任务聚焦于提示注入抵抗力、凭证意识及风险操作拒绝,呼应了大模型安全对齐的热点关切。该数据集的发布不仅为长程智能体性能提供了更贴近实际的度量标尺,也推动了智能体评估范式向真实应用场景的深刻转变,对构建可靠、鲁棒的自主代理系统具有重要指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务