遇见数据集

UniClawBench

收藏
arXiv2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

UniClawBench是由香港大学多媒体实验室与美团联合创建的首个能力驱动基准测试数据集,旨在动态真实世界环境中评估主动式智能体。该数据集包含400个双语任务,覆盖多模态理解、长上下文推理、技能使用、探索和跨平台协调五大核心能力,数据来源于手动设计的真实日常使用场景,并运行于配备实时软件和浏览器的Docker容器中。数据集的创建过程通过细粒度逐步完成检查点和隐藏评估标准,确保在缺乏稳定基准真相的动态环境中实现可靠评估。该数据集主要应用于人工智能代理研究领域,旨在系统诊断代理失败的根本原因,并分析基础模型能力与框架设计对复杂任务性能的联合影响,以推动更鲁棒的主动式助手发展。

UniClawBench is the first capability-driven benchmark dataset jointly created by the Multimedia Laboratory of The University of Hong Kong and Meituan, aiming to evaluate proactive AI Agents in dynamic real-world environments. This dataset contains 400 bilingual tasks covering five core capabilities: multimodal understanding, long-context reasoning, skill utilization, exploration and cross-platform coordination. The tasks are derived from manually designed real daily usage scenarios, and run in Docker containers equipped with real-time software and web browsers. The dataset's creation process incorporates fine-grained step-by-step checkpoints and hidden evaluation criteria, ensuring reliable evaluation in dynamic environments where stable ground truth is lacking. This dataset is primarily applied in the field of AI Agent research, aiming to systematically diagnose the root causes of agent failures, analyze the combined impact of foundation model capabilities and framework design on complex task performance, and promote the development of more robust proactive assistants.

创建时间:
2026-07-10
原始信息汇总

数据集概要

UniClawBench 是一个面向主动型 AI 智能体的双语、能力驱动的基准测试集。它通过一个包含执行器、隐藏答案监督器和公共用户模拟器的闭环系统进行评估,覆盖了长上下文推理、多模态感知、工具使用、浏览器操作、文件处理以及桌面 GUI 工作流。

核心特性

  • 评估闭环:智能体在包含三个角色的闭环中进行评估:
    • 执行器:实际操作工具、浏览器、文件及 GUI 应用的智能体后端。
    • 答案监督器:可读取私有参考文件的隐藏评估器,返回 passcontinuefail 及分数。
    • 公共用户模拟器:仅基于可见轨迹数据和监督器交握信息生成后续指令的组件。
  • 语言支持:双语(英语和中文)。
  • 任务规模:公开版本包含 400 个任务,其中 200 个为英文任务,200 个为镜像的中文任务。

任务构成

任务分布在以下五个能力家族中,每个能力家族包含 40 个英文任务和 40 个中文任务:

能力类别 英文路径 任务数 中文路径 任务数
技能使用 injection/101_skill_usage/ 40 injection/201_skill_usage_zh/ 40
探索 injection/102_exploration/ 40 injection/202_exploration_zh/ 40
长上下文 injection/103_long_context/ 40 injection/203_long_context_zh/ 40
多模态 injection/104_multimodal/ 40 injection/204_multimodal_zh/ 40
跨平台 injection/105_cross_platform/ 40 injection/205_cross_platform_zh/ 40

数据与资源

  • 任务定义:以 YAML 文件形式存储在 tasks/ 目录下。
  • 任务资源:以 injection/ 目录组织,包含 references/(参考文件)、sources/(源文件)、skills/(技能包)、services/(服务)和 .privacy(环境变量声明)文件。
  • Docker 运行时:通过 docker/ 目录下的 Dockerfile 构建,支持多种后端。
  • 配置管理:模型、Codex、API 密钥和隐私相关的配置模板位于 configs/ 目录,本地私有配置(*.local.*)被 Git 忽略。

使用流程

  1. 克隆仓库:需要 Git LFS 拉取大型任务固件。
  2. 安装依赖:Python 3.11+,通过 pip install -e . 安装包。
  3. 配置:从 configs/ 下的示例文件创建本地配置文件,填入 API 密钥等私有信息。
  4. 构建镜像:使用 scripts/build_image.sh 为所需后端构建 Docker 镜像。
  5. 运行任务
    • 单任务运行:scripts/run_eval.py
    • 批量运行:scripts/batch_eval.py
    • 分布式调度:scripts/orchestra/

结果与评估

  • 运行结果:存储在 runs/<backend>/<model_slug>/<category>/<task_id>/ 目录下。
  • 关键输出文件
    • summary.json:任务级结果摘要。
    • score.json:最终状态、分数及监督器判决详情。
    • transcript.jsonl:标准化后的交互记录。
    • tool_usage.json:工具调用统计。
    • timeline.json:各阶段时间线。
  • 评估状态:运行时会产生 infra_error(基础设施错误)、rate_limit(速率限制)、global_timeout(全局超时)等状态,这些并非答案监督器的判决。

可视化界面

  • 动态 WebUI:通过 scripts/run_webui.py 启动,提供主页、排行榜、任务目录和轨迹查看页面。
  • 静态导出:通过 webui/export_static.py 生成无后端的静态站点,可部署到 GitHub Pages 等平台,并支持将大型资源文件分离到外部存储(如 Cloudflare R2)。

可复现性

  • 仓库提供了公开的运行环境和任务集。
  • 关于论文中报告的一致性及相关系数等指标,需参考 docs/REPRODUCIBILITY.md 文档中的模型设置、时间预算和评分器配置说明。
搜集汇总
数据集介绍
UniClawBench 数据集图片
构建方式
UniClawBench以能力为导向构建,围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五大核心能力维度,手动设计了400个中英双语的真实世界任务。所有任务均在Docker容器中运行,配备真实软件、实时浏览器及本地文件系统。每个任务设计了细粒度的逐步骤完成检查点,代替预录答案以应对动态环境的不稳定性。同时引入严格的三角色闭环评估框架,包含执行代理、隐藏监督代理和用户模拟代理,通过信息防火墙机制防止评估标准泄露。
特点
该基准测试的核心特点在于能力导向的细粒度分类体系,能够精准定位代理失败的根源,而非笼统归因于场景。其独特的三角色闭环评估策略模拟了真实的多轮人机交互,用户模拟器基于可见轨迹和粗粒度进度信号生成自然反馈,监督代理则依据隐藏评价标准进行评分,两者之间通过信息防火墙严格隔离。此外,UniClawBench覆盖11个应用领域和18种输入输出类型,确保了评估的多样性和现实性。
使用方法
使用UniClawBench时,研究者首先根据任务包配置Docker环境并注入相关资源。执行代理(基于支持框架如OpenClaw、Nanobot或EDICT)运行在容器内,生成轨迹和产物。随后,隐藏监督代理依据任务特定的检查点评分标准自动评估执行质量,输出通过/失败/继续三类判定。若判定为继续,用户模拟代理仅基于可见信息和粗粒度信号提供自然语言反馈,形成多轮交互循环。最终通过通过率和平均分数两项指标评估代理性能。
背景与挑战
背景概述
随着大语言模型与多模态大语言模型的急速演进,自主智能体已从单纯的文本助手蜕变为能够操控日常工具、执行真实世界复杂任务的主动式助手。然而,现有评测基准多依赖于沙盒化环境与单轮评估范式,难以真实衡量智能体在动态、多变的现实场景中的表现。在此背景下,香港大学MMLab团队联合美团于2026年提出了UniClawBench基准,旨在填补这一关键空白。该基准聚焦于技能使用、探索、长上下文推理、多模态理解及跨平台协同五大核心能力,精心构建了400个中英双语的真实世界任务。通过引入基于隐式检查点与三角色闭环评估的创新机制,UniClawBench为精准诊断智能体失败根源提供了系统性工具,对推动主动式智能体研究向更可靠、更贴近实际应用的方向发展具有里程碑意义。
当前挑战
UniClawBench所解决的领域核心挑战在于,现有基准将任务按应用场景分类,导致模型在不同能力上的瓶颈相互混淆,例如一个“办公”任务的失败可能源自视觉感知、长上下文推理或工具使用中的任一短板,从而无法精准定位失败原因。构建过程则面临双重难题:一是真实环境缺乏稳定真值,如电商价格动态变化,使预录答案迅速失效;二是需创建闭环用户交互同时严守信息隔离,既要让用户模拟器基于智能体的可见轨迹与粗粒度进度信号提供自然反馈,又要防止其接触隐藏评估标准,避免无意中泄露评分规则。UniClawBench通过细粒度检查点评分与严格的三角色信息防火墙机制巧妙化解了这些矛盾,但其在400个任务规模下的泛化性、动态环境运行中的不稳定性,以及大模型评估本身可能引入的偏差,仍是不可忽视的挑战。
常用场景
经典使用场景
UniClawBench作为首个面向能力驱动的主动代理基准测试,其最经典的使用场景在于对大型语言模型和视觉语言模型驱动的主动代理进行多维度的系统化评估。该基准通过精心设计的400项双语真实世界任务,覆盖技能使用、探索、长上下文推理、多模态理解与跨平台协调五大核心能力维度,使研究者能够精准定位代理在动态非沙盒环境中的失败根源,从而推动代理从孤立任务执行向全天候个人助理的范式演进。
衍生相关工作
UniClawBench衍生了多个开创性研究工作:ClawBench聚焦真实网站上的写密集型操作评估,揭示了沙盒与现实环境的性能鸿沟;SkillsBench系统对比了自生成技能与精选技能对代理性能的边际效应;ClawMark构建了多天多模态共事场景的动态基准,拓展了长时域评估边界;而MetaClaw则开创了元学习演化范式,使代理能在非受控环境中持续进化。此外,EDICT等多代理框架的比较分析工作也直接受益于UniClawBench提供的标准化评估体系。
数据集最近研究
最新研究方向
UniClawBench的提出标志着主动式智能体评估从沙盒化、单轮范式向动态真实环境与能力导向评估的根本性转变。前沿研究聚焦于解耦智能体基础模型能力与框架架构对任务表现的差异化影响,实验揭示框架选择对技能调用、跨平台协调等维度的性能影响甚至超越模型本身,而长上下文推理与多模态理解仍是当前主流系统的核心瓶颈。该基准通过设计三角色闭环评估策略,即执行者、隐藏监督者与用户模拟器的信息隔离协作,首次实现了多轮人机互动场景下对智能体错误根源的精确定位,为构建更可靠的个人化数字助手提供了诊断性评估工具与清晰的优化路径。
相关研究论文
  • 1
    UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks香港大学·多媒体实验室; 美团 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务