Claw-Anything
收藏资源简介:
Claw-Anything是一个用于评估始终在线大型语言模型(LLM)智能体的基准测试和训练数据集,旨在模拟真实世界个人助理所需应对的复杂环境。核心评估维度包括长视野事件流、互联服务以及跨设备交互(包括命令行界面CLI和图形用户界面GUI)。数据集包含两个主要部分:1) 基准测试集,包含200个经过人工验证的评估任务,细分为三个子集:skill(100个,涉及动态工具加载)、tool(50个,使用完整工具集)和gui(50个,结合CLI与Android GUI交互);2) 训练集,包含2015个自动生成的任务环境,覆盖超过25种不同人物角色、4个执行日期和2个难度级别。数据以结构化表格形式提供,每条记录代表一个任务环境,关键字段包括:任务定义文件(task.yaml)、评分器代码(grader.py)、模拟服务的初始数据(fixtures)、构成智能体核心上下文的长视野事件日志(logs),以及其他辅助文件如GUI任务的截图(extras)。数据规模表明,即使是先进模型(如GPT-5.5)在该基准测试上的通过率也仅为34.5%,揭示了现有智能体能力的显著差距。数据集同时支持英文和中文任务,其独特之处在于,用于生成评估的流程同样用于生成训练数据,从而在基准测试和数据集构建之间形成了闭环。
Claw-Anything is a benchmark and training dataset for evaluating always-on large language model (LLM) agents. It is designed to simulate the complex environments faced by real-world personal assistants, with core evaluation dimensions including long-horizon event streams, interconnected services, and cross-device interactions (covering both command-line interface CLI and graphical user interface GUI). The dataset consists of two main parts: 1) A benchmark split, containing 200 manually verified evaluation tasks, further divided into three subsets: skill (100 tasks, involving dynamic tool loading), tool (50 tasks, using the full toolset), and gui (50 tasks, combining CLI with Android GUI interactions). 2) A train split, containing 2015 automatically generated task environments, covering over 25 different character roles, 4 execution dates, and 2 difficulty levels. The data is provided in a structured tabular format, where each record represents a task environment, with key fields including: task definition file (task.yaml), grader code (grader.py), initial data for simulated services (fixtures), long-horizon event logs that form the agents core context (logs), and auxiliary files such as screenshots for GUI tasks (extras). The data scale indicates that even advanced models (e.g., GPT-5.5) achieve only a 34.5% pass rate on this benchmark, revealing significant gaps in current agent capabilities. The dataset supports both English and Chinese tasks. Its uniqueness lies in the fact that the process used to generate evaluations is also used to generate training data, forming a closed loop between benchmark testing and dataset construction.
数据集概述
Claw-Anything 是一个用于评估和训练始终在线(always-on)LLM 智能体的基准数据集,重点关注真实世界的三个维度:长时事件流、互联服务和跨设备交互(GUI + CLI)。
- 发布机构:LiberCoders
- 许可证:Apache 2.0
- 语言:英语(en)、中文(zh)
- 数据集大小:1K < n < 10K
- 论文:arXiv 2605.26086
- 代码仓库:GitHub - LiberCoders/CLaw-Anything
数据集拆分
| 拆分 | 任务数 | 绑定数 | 内容描述 |
|---|---|---|---|
benchmark(基准) |
200 | 3 | 人工验证的评估任务,包括:skill/(100个,动态工具加载)、tool/(50个,完整工具集)、gui/(50个,CLI + Android GUI) |
train(训练) |
2015 | 289 | 自动生成的训练环境,覆盖25+个角色 × 4个执行日期 × 2个难度级别 |
与其他基准的对比
| 基准 | 事件流 | 设备接口 | 平均/最大服务数 | 主动能力 | 平均上下文(词数) | 评估任务数 | 训练任务数 |
|---|---|---|---|---|---|---|---|
| 其他基准 | ✗ | CLI | 0.1–1.6 / 3–6 | ✗ | 1.7k–5.3k | 53–313 | 0 |
| Claw-Anything | ✓ | CLI + GUI | 10.1 / 18 | ✓ | 191.7k | 200 | 2000 |
数据模式(Schema)
每个数据行包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
split |
str | "benchmark" 或 "train" |
bundle |
str | 所属绑定目录(skill, tool, gui 或 <角色>_..._<难度>) |
task_id |
str | 任务目录名,在绑定内唯一 |
task_yaml |
str | 原始 task.yaml 文本(提示、服务、评分组件、安全检查) |
grader_py |
str | 原始 grader.py 文本(AbstractGrader 子类),缺失则为空 |
fixtures |
str | JSON对象,包含{相对路径: {encoding, content}},表示fixtures/目录中的模拟服务种子数据 |
logs |
str | JSON对象(结构同上),表示logs/目录中的长时事件流(核心上下文数据),如周报、工作日志、服务活动记录 |
extras |
str | JSON对象,包含其余辅助文件(如GUI任务的screenshots/*.png) |
language |
str | 自动检测的语言("en" 或 "zh") |
n_fixtures |
int64 | fixture文件数量 |
n_logs |
int64 | 日志文件数量(平均约17个,最多50+) |
n_extras |
int64 | 额外文件数量(非GUI任务通常为0) |
往返保证:通过提供的 materialize.py 脚本可以从任何数据行重建完整的任务目录,与原始目录字节级一致(除 __pycache__/ 外)。
快速使用
安装运行器: bash git clone https://github.com/LiberCoders/Claw-Anything.git cd Claw-Anything uv venv --python 3.11 && source .venv/bin/activate uv pip install -e ".[mock,sandbox]" cp config.example.yaml config.yaml # 填写 api_key / base_url / model_id claw-anything build-image --agent loop # 最小化
或:claw-anything build-image --agent openharness-ext # GUI任务必需
材料化任务:使用 materialize.py 脚本从数据集下载并重建任务目录(脚本内容见README)。
基准评估(一步完成): bash python materialize.py --split benchmark --out ./benchmark_local claw-anything batch --tasks-dir ./benchmark_local --config config.yaml --trial-in-container --trials 3 --parallel 10
- 支持按子集(
skill/tool/gui)单独评估 - 结果输出在
traces/<agent>_<model>_<timestamp>/目录下
训练轨迹生成(一步完成): bash python materialize.py --split train --out ./train_local claw-anything batch --tasks-dir ./train_local --config config.yaml --trial-in-container --trials 1 --parallel 20
- 每个试验生成JSONL轨迹,可用于SFT/偏好学习
- 支持断点续跑(
--continue跳过已完成,--rerun-errors重试失败任务)
引用
bibtex @article{lin2026clawanything, title = {Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to Users Digital World}, author = {Lin, Yusong and Liang, Xinyuan and Wang, Haiyang and Gu, Qipeng and Cheng, Siqi and Chen, Jiangui and Wu, Shuzhe and Pan, Feiyang and Fan, Lue and Zhao, Sanyuan and Tu, Dandan}, year = {2026}, journal = {arXiv preprint arXiv:2605.26086} }




