UniClawBench
收藏资源简介:
UniClawBench是由香港大学多媒体实验室与美团联合创建的首个能力驱动基准测试数据集,旨在动态真实世界环境中评估主动式智能体。该数据集包含400个双语任务,覆盖多模态理解、长上下文推理、技能使用、探索和跨平台协调五大核心能力,数据来源于手动设计的真实日常使用场景,并运行于配备实时软件和浏览器的Docker容器中。数据集的创建过程通过细粒度逐步完成检查点和隐藏评估标准,确保在缺乏稳定基准真相的动态环境中实现可靠评估。该数据集主要应用于人工智能代理研究领域,旨在系统诊断代理失败的根本原因,并分析基础模型能力与框架设计对复杂任务性能的联合影响,以推动更鲁棒的主动式助手发展。
UniClawBench is the first capability-driven benchmark dataset jointly created by the Multimedia Laboratory of The University of Hong Kong and Meituan, aiming to evaluate proactive AI Agents in dynamic real-world environments. This dataset contains 400 bilingual tasks covering five core capabilities: multimodal understanding, long-context reasoning, skill utilization, exploration and cross-platform coordination. The tasks are derived from manually designed real daily usage scenarios, and run in Docker containers equipped with real-time software and web browsers. The dataset's creation process incorporates fine-grained step-by-step checkpoints and hidden evaluation criteria, ensuring reliable evaluation in dynamic environments where stable ground truth is lacking. This dataset is primarily applied in the field of AI Agent research, aiming to systematically diagnose the root causes of agent failures, analyze the combined impact of foundation model capabilities and framework design on complex task performance, and promote the development of more robust proactive assistants.
数据集概要
UniClawBench 是一个面向主动型 AI 智能体的双语、能力驱动的基准测试集。它通过一个包含执行器、隐藏答案监督器和公共用户模拟器的闭环系统进行评估,覆盖了长上下文推理、多模态感知、工具使用、浏览器操作、文件处理以及桌面 GUI 工作流。
核心特性
- 评估闭环:智能体在包含三个角色的闭环中进行评估:
- 执行器:实际操作工具、浏览器、文件及 GUI 应用的智能体后端。
- 答案监督器:可读取私有参考文件的隐藏评估器,返回
pass、continue或fail及分数。 - 公共用户模拟器:仅基于可见轨迹数据和监督器交握信息生成后续指令的组件。
- 语言支持:双语(英语和中文)。
- 任务规模:公开版本包含 400 个任务,其中 200 个为英文任务,200 个为镜像的中文任务。
任务构成
任务分布在以下五个能力家族中,每个能力家族包含 40 个英文任务和 40 个中文任务:
| 能力类别 | 英文路径 | 任务数 | 中文路径 | 任务数 |
|---|---|---|---|---|
| 技能使用 | injection/101_skill_usage/ |
40 | injection/201_skill_usage_zh/ |
40 |
| 探索 | injection/102_exploration/ |
40 | injection/202_exploration_zh/ |
40 |
| 长上下文 | injection/103_long_context/ |
40 | injection/203_long_context_zh/ |
40 |
| 多模态 | injection/104_multimodal/ |
40 | injection/204_multimodal_zh/ |
40 |
| 跨平台 | injection/105_cross_platform/ |
40 | injection/205_cross_platform_zh/ |
40 |
数据与资源
- 任务定义:以 YAML 文件形式存储在
tasks/目录下。 - 任务资源:以
injection/目录组织,包含references/(参考文件)、sources/(源文件)、skills/(技能包)、services/(服务)和.privacy(环境变量声明)文件。 - Docker 运行时:通过
docker/目录下的 Dockerfile 构建,支持多种后端。 - 配置管理:模型、Codex、API 密钥和隐私相关的配置模板位于
configs/目录,本地私有配置(*.local.*)被 Git 忽略。
使用流程
- 克隆仓库:需要 Git LFS 拉取大型任务固件。
- 安装依赖:Python 3.11+,通过
pip install -e .安装包。 - 配置:从
configs/下的示例文件创建本地配置文件,填入 API 密钥等私有信息。 - 构建镜像:使用
scripts/build_image.sh为所需后端构建 Docker 镜像。 - 运行任务:
- 单任务运行:
scripts/run_eval.py - 批量运行:
scripts/batch_eval.py - 分布式调度:
scripts/orchestra/
- 单任务运行:
结果与评估
- 运行结果:存储在
runs/<backend>/<model_slug>/<category>/<task_id>/目录下。 - 关键输出文件:
summary.json:任务级结果摘要。score.json:最终状态、分数及监督器判决详情。transcript.jsonl:标准化后的交互记录。tool_usage.json:工具调用统计。timeline.json:各阶段时间线。
- 评估状态:运行时会产生
infra_error(基础设施错误)、rate_limit(速率限制)、global_timeout(全局超时)等状态,这些并非答案监督器的判决。
可视化界面
- 动态 WebUI:通过
scripts/run_webui.py启动,提供主页、排行榜、任务目录和轨迹查看页面。 - 静态导出:通过
webui/export_static.py生成无后端的静态站点,可部署到 GitHub Pages 等平台,并支持将大型资源文件分离到外部存储(如 Cloudflare R2)。
可复现性
- 仓库提供了公开的运行环境和任务集。
- 关于论文中报告的一致性及相关系数等指标,需参考
docs/REPRODUCIBILITY.md文档中的模型设置、时间预算和评分器配置说明。

- 1UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks香港大学·多媒体实验室; 美团 · 2026年



