遇见数据集

Claw-Anything

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

Claw-Anything是一个用于评估始终在线大型语言模型(LLM)智能体的基准测试和训练数据集,旨在模拟真实世界个人助理所需应对的复杂环境。核心评估维度包括长视野事件流、互联服务以及跨设备交互(包括命令行界面CLI和图形用户界面GUI)。数据集包含两个主要部分:1) 基准测试集,包含200个经过人工验证的评估任务,细分为三个子集:skill(100个,涉及动态工具加载)、tool(50个,使用完整工具集)和gui(50个,结合CLI与Android GUI交互);2) 训练集,包含2015个自动生成的任务环境,覆盖超过25种不同人物角色、4个执行日期和2个难度级别。数据以结构化表格形式提供,每条记录代表一个任务环境,关键字段包括:任务定义文件(task.yaml)、评分器代码(grader.py)、模拟服务的初始数据(fixtures)、构成智能体核心上下文的长视野事件日志(logs),以及其他辅助文件如GUI任务的截图(extras)。数据规模表明,即使是先进模型(如GPT-5.5)在该基准测试上的通过率也仅为34.5%,揭示了现有智能体能力的显著差距。数据集同时支持英文和中文任务,其独特之处在于,用于生成评估的流程同样用于生成训练数据,从而在基准测试和数据集构建之间形成了闭环。

Claw-Anything is a benchmark and training dataset for evaluating always-on large language model (LLM) agents. It is designed to simulate the complex environments faced by real-world personal assistants, with core evaluation dimensions including long-horizon event streams, interconnected services, and cross-device interactions (covering both command-line interface CLI and graphical user interface GUI). The dataset consists of two main parts: 1) A benchmark split, containing 200 manually verified evaluation tasks, further divided into three subsets: skill (100 tasks, involving dynamic tool loading), tool (50 tasks, using the full toolset), and gui (50 tasks, combining CLI with Android GUI interactions). 2) A train split, containing 2015 automatically generated task environments, covering over 25 different character roles, 4 execution dates, and 2 difficulty levels. The data is provided in a structured tabular format, where each record represents a task environment, with key fields including: task definition file (task.yaml), grader code (grader.py), initial data for simulated services (fixtures), long-horizon event logs that form the agents core context (logs), and auxiliary files such as screenshots for GUI tasks (extras). The data scale indicates that even advanced models (e.g., GPT-5.5) achieve only a 34.5% pass rate on this benchmark, revealing significant gaps in current agent capabilities. The dataset supports both English and Chinese tasks. Its uniqueness lies in the fact that the process used to generate evaluations is also used to generate training data, forming a closed loop between benchmark testing and dataset construction.

创建时间:
2026-05-23
原始信息汇总

数据集概述

Claw-Anything 是一个用于评估和训练始终在线(always-on)LLM 智能体的基准数据集,重点关注真实世界的三个维度:长时事件流互联服务跨设备交互(GUI + CLI)

数据集拆分

拆分 任务数 绑定数 内容描述
benchmark(基准) 200 3 人工验证的评估任务,包括:skill/(100个,动态工具加载)、tool/(50个,完整工具集)、gui/(50个,CLI + Android GUI)
train(训练) 2015 289 自动生成的训练环境,覆盖25+个角色 × 4个执行日期 × 2个难度级别

与其他基准的对比

基准 事件流 设备接口 平均/最大服务数 主动能力 平均上下文(词数) 评估任务数 训练任务数
其他基准 CLI 0.1–1.6 / 3–6 1.7k–5.3k 53–313 0
Claw-Anything CLI + GUI 10.1 / 18 191.7k 200 2000

数据模式(Schema)

每个数据行包含以下字段:

字段 类型 描述
split str "benchmark""train"
bundle str 所属绑定目录(skill, tool, gui<角色>_..._<难度>
task_id str 任务目录名,在绑定内唯一
task_yaml str 原始 task.yaml 文本(提示、服务、评分组件、安全检查)
grader_py str 原始 grader.py 文本(AbstractGrader 子类),缺失则为空
fixtures str JSON对象,包含{相对路径: {encoding, content}},表示fixtures/目录中的模拟服务种子数据
logs str JSON对象(结构同上),表示logs/目录中的长时事件流(核心上下文数据),如周报、工作日志、服务活动记录
extras str JSON对象,包含其余辅助文件(如GUI任务的screenshots/*.png
language str 自动检测的语言("en""zh"
n_fixtures int64 fixture文件数量
n_logs int64 日志文件数量(平均约17个,最多50+)
n_extras int64 额外文件数量(非GUI任务通常为0)

往返保证:通过提供的 materialize.py 脚本可以从任何数据行重建完整的任务目录,与原始目录字节级一致(除 __pycache__/ 外)。

快速使用

安装运行器: bash git clone https://github.com/LiberCoders/Claw-Anything.git cd Claw-Anything uv venv --python 3.11 && source .venv/bin/activate uv pip install -e ".[mock,sandbox]" cp config.example.yaml config.yaml # 填写 api_key / base_url / model_id claw-anything build-image --agent loop # 最小化

或:claw-anything build-image --agent openharness-ext # GUI任务必需

材料化任务:使用 materialize.py 脚本从数据集下载并重建任务目录(脚本内容见README)。

基准评估(一步完成): bash python materialize.py --split benchmark --out ./benchmark_local claw-anything batch --tasks-dir ./benchmark_local --config config.yaml --trial-in-container --trials 3 --parallel 10

  • 支持按子集(skill/tool/gui)单独评估
  • 结果输出在 traces/<agent>_<model>_<timestamp>/ 目录下

训练轨迹生成(一步完成): bash python materialize.py --split train --out ./train_local claw-anything batch --tasks-dir ./train_local --config config.yaml --trial-in-container --trials 1 --parallel 20

  • 每个试验生成JSONL轨迹,可用于SFT/偏好学习
  • 支持断点续跑(--continue 跳过已完成,--rerun-errors 重试失败任务)

引用

bibtex @article{lin2026clawanything, title = {Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to Users Digital World}, author = {Lin, Yusong and Liang, Xinyuan and Wang, Haiyang and Gu, Qipeng and Cheng, Siqi and Chen, Jiangui and Wu, Shuzhe and Pan, Feiyang and Fan, Lue and Zhao, Sanyuan and Tu, Dandan}, year = {2026}, journal = {arXiv preprint arXiv:2605.26086} }

搜集汇总
数据集介绍
Claw-Anything 数据集图片
构建方式
Claw-Anything数据集的构建采用了闭环设计,将评测与数据生成紧密结合。研究者首先设计了涵盖长时事件流、跨设备交互(GUI+CLI)和互联服务三大维度的基准任务,并据此开发了一致的数据管线,自动生成带有详细标注的训练样本。通过模拟25种以上用户画像、4个执行日期和2个难度等级,构建了包含约2000个训练环境的丰富场景。每个任务均包含完整的task.yaml提示、评分脚本、模拟服务种子数据以及核心的长期事件流日志,确保了数据的高质量与可复现性。
特点
该数据集的核心特点在于其卓越的全面性与现实模拟深度。它不仅引入了前所未有的约192k词的长上下文事件流,还整合了平均超过10个互联服务,远超现有基准。尤为独特的是,数据集统一封裝了命令行界面(CLI)与安卓图形界面(GUI)的跨设备交互,并支持智能体的主动式服务调用。数据的'round-trip'特性保证了从数据集还原的任务目录与原始环境字节级一致,为可重复实验奠定了坚实基础。
使用方法
使用Claw-Anything数据集时,需先通过GitHub仓库安装`claw-anything`运行器并配置API。用户可利用提供的`materialize.py`脚本从HuggingFace Hub下载并还原指定分片(benchmark或train)的任务目录。针对评测,执行`claw-anythinng batch`命令即可在沙箱容器中运行多轮评估并生成详细轨迹。对于训练,则在同一批任务上运行智能体以收集`Think→Act→Observe`的轨迹数据,这些数据可直接用于监督微调或偏好学习,提升模型在复杂数字世界中的代理能力。
背景与挑战
背景概述
随着大型语言模型(LLM)的快速发展,如何构建能够全天候(always-on)感知用户数字生活并主动提供协助的智能个人助手,成为人工智能领域的前沿挑战。现有的基准测试如ClawBench、PinchBench等,通常局限于单一设备接口(仅CLI)或短期任务序列,未能反映真实世界中长时事件流、多服务互联及跨设备交互的复杂性。在此背景下,由Yusong Lin、Xinyuan Liang等研究者于2026年发布的Claw-Anything数据集应运而生。该数据集包含200个经人工验证的评测任务与2015个自动生成的训练环境,跨越25种以上用户画像、4个执行日期及2种难度级别,旨在评测智能体在长程事件流、互联服务和跨设备(GUI+CLI)交互三个核心维度上的能力。其提出的ClawBench评测体系,将平均服务数量提升至10.1个、上下文长度扩展至191.7k词,显著超越以往基准,为评估和训练下一代全天候个人助手提供了标准化的平台。
当前挑战
Claw-Anything数据集所解决的核心领域挑战在于,现有LLM智能体评测体系严重脱节于真实世界中全天候个人助手的应用场景。具体表现为:1)真实用户环境中存在持续更新的长周期事件流(如周报、工作日志),智能体需具备对历史上下文的持久化记忆与推理能力;2)数字生活涉及日历、邮件、文件、消息等多服务协同,智能体需在服务间灵活切换与调用工具,而现有基准平均仅覆盖1-2个服务;3)跨设备交互(CLI与Android GUI)带来了异构接口的融合难题,智能体需同时理解命令行输出与图形界面截图。在构建过程中,团队还面临以下挑战:生成涵盖多样人物画像与时间线的模拟日志需兼顾真实性、连贯性与隐私保护;跨服务mock数据的注入需保证环境可重放且无泄漏;GUI任务中截图与指令的时序对齐也增加了自动化生成与验证的复杂性。
常用场景
经典使用场景
在持续感知型个人助手的研究领域中,Claw-Anything最为经典的应用场景是作为评估具备广泛数字世界接入能力的大语言模型代理的统一基准。该数据集精心设计了包含长时域事件流、跨设备交互(图形界面与命令行界面)以及互联服务协同的三维任务框架,通过200个经过人工验证的评测任务,系统性地考察代理在复杂数字环境中的决策与执行能力。研究者可以借此精准衡量模型在持续运行、多服务协调和多界面操作等真实场景下的综合表现。
解决学术问题
该数据集的核心学术贡献在于填补了现有基准无法有效评估持续感知型助手的显著空白。此前,ClawBench、WildClawBench等评测方案只涉及单一命令行界面,且上下文长度有限、服务数量稀少,无法反映真实世界中代理长期在线、跨平台交互的复杂需求。Claw-Anything通过引入长达191.7k词的上下文流和最多18个服务接口的任务设计,揭示了即便是GPT-5.5也仅能达到34.5% pass@1的惊人能力缺口,从而为后续研究指明了关键性能瓶颈与改进方向。
衍生相关工作
Claw-Anything催生了一系列具有影响力的后续工作。最直接的衍生成果是Claw-Anything-Qwen3.5-27B模型,该模型基于数据集生成的训练轨迹进行监督微调,相较基础版本在pass@1上取得了23.7个百分点的显著提升。此外,数据集的开放式架构和可重复性保障机制鼓励了更多关于代理长期记忆建模、多模态交互策略、以及安全约束条件下的工具调用等方向的研究,标志着持续感知型代理领域从静态评测向动态能力演进的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务