遇见数据集

Claw-Anything

收藏
github2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

Claw-Anything 是一个用于评估始终在线LLM代理的基准数据集,涵盖三个维度的真实世界上下文:长时事件流、互连服务和跨设备交互。它包含2000个训练环境和自动化数据生成管道,旨在扩展代理的上下文访问能力。

Claw-Anything is a benchmark dataset for evaluating always-on LLM agents. It encompasses real-world contexts across three dimensions: long-term event streams, interconnected services, and cross-device interactions. It includes 2000 training environments and an automated data generation pipeline, designed to enhance agents' contextual access capabilities.

创建时间:
2026-05-08
原始信息汇总

数据集概述

Claw-Anything 是一个面向始终在线(always-on)个人助手场景的端到端基准测试与数据生成框架。其核心目标是通过扩展智能体可感知、推理和行动的“上下文范围”(scaling agent context),来评估和提升大语言模型(LLM)在真实数字世界中的表现。

核心组成部分

模块 功能
基准测试 (benchmark/) 包含 200 个经过人工验证的任务,分为 skill(按需加载工具)和 tool(预加载全套工具)两类。
数据生成 (gen/) 自动化双阶段流水线(build-personagen-eval),可生成 2000 个训练环境。
执行器 (runner/) 实现“思考→行动→观察”循环,支持OpenAI兼容的模型后端,并采用Docker沙箱隔离。
评分器 (graders/) 多维度评分机制,包括完成度、鲁棒性、通讯与安全性,支持LLM作为评判。
模拟服务 (mock_services/) 35个FastAPI模拟服务(如Gmail、日历、Slack、Notion、飞书、微信、Zotero等),共享固定时间轴的底座。

扩展上下文的三个维度

Claw-Anything 从三个维度同时扩展智能体的上下文:

  • 长时间跨度的事件流:覆盖数月的细粒度用户活动,要求智能体在演变的时间线上进行推理。
  • 互联的服务:信息分散于多个有状态的后端服务,服务间可能存在信号冲突,要求跨服务协调。
  • 跨设备交互(图形界面 + 命令行界面):智能体需在异构的GUI和CLI界面间协同操作,充当用户日常生活的连接器。

基准测试统计

指标 数值
评估任务数 200(人工验证)
训练环境数 2000(自动生成)
平均/最大服务数 10.1 / 18
事件流
设备接口 CLI + GUI
支持主动式任务
平均上下文长度 191.7k 词
对比基准覆盖范围 超越现有基准(如ClawBench、WildClawBench等)

主要结果

模型 Pass@1 关键发现
GPT-5.5 34.5% 最强闭源模型,但仍有显著能力缺口
Claw-Anything-Qwen3.5-27B 33.5% 基于2000个训练环境微调,较基线提升**+23.7**个百分点
GLM-5.1 31.7% 开源模型中的有力竞争者
Qwen3.6-27B 22.5% 参数效率较高的开源模型

数据生成流水线

  • 第一阶段(build-persona):基于人物设定(persona)YAML,构建包含模拟用户活动的完整数字世界和环境。
  • 第二阶段(gen-eval):从黄金环境中自动生成评估任务,包括任务查询、参考解决方案、评分器和噪声事件。
  • 可扩展性:支持30轮迭代,可配置噪声比例(默认2),自动过滤生成的任务实例。

环境与依赖

  • Python版本要求:3.11+
  • 可选依赖:Docker(用于容器内试验沙箱)
  • 依赖管理工具:uv
  • 模拟服务:FastAPI后端,覆盖35种常见服务
  • 移动端支持:通过ADB驱动Android模拟器,支持GUI任务执行
搜集汇总
数据集介绍
Claw-Anything 数据集图片
构建方式
Claw-Anything数据集的构建基于一套全自动化的两阶段数据生成流水线。首先,通过“build-persona”阶段,从一个单一的人物种子文件出发,结合模拟的长期用户活动、持久化服务状态及噪声事件,迭代生成一个包含数个月模拟用户行为的“黄金环境”。随后,“gen-eval”阶段利用大型语言模型模拟器,基于该环境生成任务查询、参考解决方案与评估器,并经自动过滤与人工验证,最终产出高质量的评测实例与大规模训练环境。
特点
该数据集在三个维度上扩展了智能体的上下文范围:长期事件流,涵盖数月粒度精细的用户活动,要求智能体在动态时间线上进行推理;互联服务,信息分散于多个有状态后端,服务间信号可能存在冲突,考验跨服务协调能力;跨设备交互,融合图形界面与命令行界面,模拟真实多设备场景。此外,数据集支持主动式辅助评估,并包含200个人工验证的评测任务与2000个训练环境。
使用方法
使用者可通过安装Python 3.11+环境与Docker沙箱,利用Claw-Anything提供的命令行工具快速上手。运行完整评测套件使用“claw-anything batch”命令,支持子集选择与并行执行。单一任务测试可通过“run”命令配合不同智能体后端(如循环智能体、OpenHarness变体)及容器化选项进行。数据生成功能则通过“build-persona”与“gen-eval”两阶段流水线实现,允许基于自定义人物种子与种子任务创建全新评测场景。
背景与挑战
背景概述
Claw-Anything数据集由华为的研究团队(包括Yusong Lin、Xinyuan Liang、Haiyang Wang等)于2026年创建,旨在解决始终在线的大语言模型代理在真实世界中感知、推理和行动的局限性。现有代理基准仅关注狭窄、静态的用户状态片段,而Claw-Anything开创性地从三个维度扩展代理上下文:长时程事件流(跨越数月的细粒度用户活动)、互联服务(信息散落在多个有状态后端中,要求跨服务协调)以及跨设备交互(整合图形界面与命令行界面)。该数据集包含200个人工验证的评估任务和2000个自动生成的训练环境,即便最强的GPT-5.5模型在其上仅达到34.5%的Pass@1,揭示了当前代理能力与真实需求间的显著鸿沟,对智能体领域产生了深远影响。
当前挑战
Claw-Anything面临的领域挑战在于,始终在线的个人助理需要应对长期依赖的复杂事件流、分散在多个服务中的矛盾信号以及异构设备间的无缝协作,这些远超现有单API工具调用或静态指令跟随能力。构建过程中,团队需设计一个端到端的自动化数据生成流水线,从角色种子出发模拟数月用户活动,同时注入无关事件和冲突信息以模拟真实世界的噪声;还需为35个FastAPI模拟服务(如Gmail、日历、Slack)创建共享的冻结时间基座,并确保每个任务具备可执行的评分器(涵盖完成度、鲁棒性、通信和安全多个维度)。此外,跨设备交互场景需要同时协调Android模拟器和Docker容器的状态注入,给工程实现带来了显著挑战。
常用场景
经典使用场景
Claw-Anything数据集致力于评估和增强始终在线的个人智能助手在复杂数字世界中的上下文感知能力。该数据集通过构建包含数月细粒度用户活动的事件流、多达18种互联的后端服务(如邮件、日历、即时通讯)以及跨设备图形与命令行界面的综合交互场景,为研究提供了高度仿真的实验平台。典型使用中,研究者利用其200个精心设计的人工验证任务,测试智能体在长跨度时间线推理、跨服务信息协调及异构设备协同操作上的表现。数据集还包括2000个自动生成的训练环境,用于微调模型,使其能够处理日常办公、信息管理等多步骤依赖的复杂任务。
衍生相关工作
Claw-Anything的发布催生了一系列衍生研究方向,主要聚焦于智能体上下文扩展与自动评估框架的优化。基于其数据流水线,研究者得以构建更精细化的用户模拟环境,推动了个性化助手行为建模的工作。此外,该数据集提供的2000个训练环境及自动评分机制,被广泛用于对比不同模型架构在长序列推理与多工具调用上的表现,例如后续工作探索了将检索增强生成与记忆网络结合以提升事件流理解能力。数据集对主动辅助任务的强调,也激发了关于智能体预判用户需求、在模糊指令下采取行动等课题的深入探讨,形成了从基准测试到训练方法迭代的完整研究闭环。
数据集最近研究
最新研究方向
Claw-Anything数据集聚焦于持续在线个人助手(always-on LLM agents)在长期事件流、多服务互联与跨设备交互(GUI+CLI)三轴维度下的上下文扩展能力。当前前沿研究方向集中于突破现有基准在静态、狭窄用户状态上的局限,推动智能体在数月的细粒度用户活动历史中进行推理,在数十个相互关联的后端服务间协调行动,并实现跨异构界面的统一操作。该数据集通过自动化数据生成管线构建了2000个训练环境,揭示了即便最强的GPT-5.5模型在Pass@1上也仅达34.5%,而基于该数据微调的Qwen3.5-27B获得了23.7%的显著提升,逼近闭源前沿系统。这一工作标志着智能体评估正从孤立的API调用向真实世界全场景辅助能力迈进,为构建真正主动、可感知用户完整数字生活的个人助手奠定了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务