遇见数据集

WildClawBench-Trajectories

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

WildClawBench Trajectories 数据集包含从 WildClawBench 评估中收集的完整 OpenClaw agent 轨迹。该数据集旨在支持 agent 轨迹的基准测试与评估,共包含 600 条轨迹,覆盖 60 个基准任务和 10 个模型。数据以 train.parquet 文件形式提供,包含以下字段:task_id(任务标识符)、trajectory(完整消息序列的 JSON 数组)、model_name(评估模型名称)和 task_category(任务类别,属于 WildClawBench 的六种类别之一)。为保持数据集查看器稳定加载,轨迹中的内联 base64 图像被替换为包含原始载荷长度和 SHA-256 摘要的占位符,但消息顺序、图像位置、MIME 类型、文本、推理、工具调用和工具结果均被保留。原始图像和任务工件可在对应的源档案中获取。此外,sessions/ 目录下提供了每个模型和任务的 Pi session v3 JSONL 文件,可用于 Hugging Face Agent Trace Viewer 查看完整会话时间线、推理块、模型响应、令牌使用、工具调用和结果。每个会话头部包含 trace_status 字段,标识状态为 completed(567 条)、error(7 条)或 interrupted(26 条)。error 和 interrupted 会话在 Trace Viewer 中会显示最终警告块。数据集许可证为 Apache-2.0,支持英语和中文,适用于文本生成任务,标签包括代码、agent、基准、评估等。

The WildClawBench Trajectories dataset contains complete OpenClaw agent trajectories collected from the WildClawBench evaluation. This dataset aims to support benchmarking and evaluation of agent trajectories, comprising 600 trajectories across 60 benchmark tasks and 10 models. The data is provided as a train.parquet file with the following fields: task_id (task identifier), trajectory (JSON array of complete message sequences), model_name (evaluated model name), and task_category (one of the six categories in WildClawBench). To ensure stable loading of the dataset viewer, inline base64 images in trajectories are replaced with placeholders containing the original payload length and SHA-256 hash, while preserving message order, image positions, MIME types, text, reasoning, tool calls, and tool results. Original images and task artifacts can be obtained from the corresponding source archives. Additionally, the sessions/ directory provides Pi session v3 JSONL files for each model and task, which can be used with the Hugging Face Agent Trace Viewer to view the complete session timeline, reasoning blocks, model responses, token usage, tool calls, and results. Each session header includes a trace_status field indicating whether the status is completed (567), error (7), or interrupted (26). Error and interrupted sessions will display a final warning block in the Trace Viewer. The dataset is licensed under Apache-2.0, supports English and Chinese, is suitable for text generation tasks, and is tagged with code, agent, benchmark, evaluation, etc.

提供机构:
InternLM
创建时间:
2026-07-30
原始信息汇总

WildClawBench Trajectories 数据集概述

基本信息

  • 许可证:Apache-2.0
  • 任务类型:文本生成
  • 语言:英语、中文
  • 标签:代码、智能体、基准测试、轨迹、评估、追踪、OpenClaw
  • 数据规模:少于1K条(n<1K)

数据集内容

该数据集包含从WildClawBench评估中收集的完整OpenClaw智能体轨迹。当前版本包含600条轨迹,涵盖60个基准任务10个评估模型

数据集中包含完整的消息序列、模型名称和任务类别等信息。

数据结构

数据文件为train.parquet,主要字段包括:

字段 说明
task_id WildClawBench任务标识符
trajectory 完整消息序列,以JSON数组形式序列化
model_name 评估模型的显示名称
task_category WildClawBench六大任务类别之一

为保证Dataset Viewer行数据量可控,内联的base64图像载荷被替换为包含原始载荷长度和SHA-256摘要的占位符。消息顺序、图像位置、MIME类型、文本、推理、工具调用和工具结果均被保留。原始图像载荷和所有任务工件可在对应的源归档中获取。

会话追踪文件

sessions/目录包含每个模型和任务的Pi会话v3格式JSONL文件,路径结构为:

sessions/<模型名称>/<任务ID>.jsonl

这些追踪文件保留了原始的内联图像数据,可用于查看完整时间线、推理块、模型响应、令牌使用、工具调用、工具参数和工具结果。

追踪状态说明

每个会话头部包含trace_status字段,状态分为三类:

  • completed:执行干净结束
  • error:模型返回明确错误
  • interrupted:一个或多个工具调用没有记录结果

当前版本包含:567个已完成、7个错误、26个中断的追踪。

使用示例

python from datasets import load_dataset

dataset = load_dataset("internlm/WildClawBench-Trajectories") sample = dataset["train"][0]

搜集汇总
数据集介绍
WildClawBench-Trajectories 数据集图片
构建方式
该数据集源于WildClawBench基准测试的完整评估记录,构建过程覆盖60项任务套件下多个前沿模型的长时程智能体运行实例,逐条捕获每轮对话中的消息、推理块、工具调用与工具结果,并将同一批数据以三种形态同步呈现:面向Hugging Face数据集查看器的train.parquet、保留原始内联图像数据的sessions目录JSONL轨迹文件,以及记录逐任务评分、用量与产物的output压缩包。为保障查看器加载的稳定性,parquet中的内联图像载荷以哈希占位符替代,仅保留位置、类型与文本信息,原始图像则完整留存于其余两种形态。
特点
数据集以真实长时程智能体执行为核心,完整保留从模型响应到工具结果的逐层细节,兼具轨迹级可追溯性与原始产物可核验性。数据覆盖多个评估模型且随排行榜更新持续扩充,每一模型均遍历全部60项任务,囊括六大任务类别。其结构既支持以单次任务与模型组合为粒度进行检索,也支持通过轨迹查看器还原会话时间线与推理过程,并借trace_status字段区分正常完成、显式报错与工具调用中断三种终止状态,为交叉验证、横向比较与细粒度行为分析提供统一依据。
使用方法
研究者可借助datasets库直接加载该数据集,以行为单位获取任务标识、模型名称、任务类别与序列化后的完整消息轨迹,并通过条件筛选提取特定模型的全部运行记录,再经JSON解析还原消息序列以开展分析。若需审视原始内联图像与完整时间线,可转入sessions目录下的Pi会话文件,在轨迹查看器中逐项检查推理块、工具参数与工具结果。对于涉及评分、用量、日志及智能体产出文件的需求,则可下载对应模型的output压缩包进行解压核验,从而实现从轨迹到原始输出的贯通式使用。
背景与挑战
背景概述
伴随自主智能体在真实长程任务中的广泛应用,如何对其行为轨迹进行细粒度评测已成为智能体研究的核心议题。WildClawBench-Trajectories由上海人工智能实验室InternLM团队于2026年发布,依托WildClawBench基准,系统收录了前沿模型在全部60项长程任务上的完整执行轨迹,涵盖消息、推理块、工具调用与结果,并随排行榜持续更新。该数据集以开放可验证的姿态回应了智能体评测中过程透明性不足的痛点,为逐轨迹复现、跨模型横向比较与失败模式剖析提供了关键基础设施,对推动长程智能体研究具有重要价值。
当前挑战
该数据集所服务的核心领域问题在于长程智能体的真实环境评测,其挑战源于任务本身的多步依赖、工具交互与环境不确定性,要求模型在开放动态条件下维持连贯决策。构建层面亦面临多重难题:轨迹中内嵌的base64图像载荷体积庞大,需以哈希占位符替代以兼顾可加载性与信息完整性;不同模型返回的错误或中断会话须在不篡改原始事件的前提下显式标注;跨模型、跨任务轨迹的标准化序列化与持续更新机制,进一步对数据一致性与可复现性提出了严峻考验。
常用场景
经典使用场景
在大规模语言模型智能体评估领域,对长程任务执行过程的细粒度审视已成为衡量模型真实能力的关键途径。WildClawBench-Trajectories 数据集完整记录了前沿模型在 WildClawBench 全部六十项任务中的 OpenClaw 智能体运行轨迹,涵盖每一条消息、推理区块、工具调用及工具返回结果,为研究者提供了逐条轨迹的原始素材。研究者可借助 Hugging Face Agent Trace Viewer 按模型与任务维度还原完整会话时间线,或通过 load_dataset 接口批量加载轨迹并解析消息序列,从而实现模型间的并排比对与失败模式的溯源定位。
解决学术问题
智能体研究长期面临评估过程不可复现、推理链路难以追溯的困境,模型在长程任务中的失败究竟源于规划偏差、工具误用抑或上下文遗失,往往缺乏实证依据。该数据集以轨迹级别的完整记录回应了这一难题,使研究者能够对推理区块、工具参数与执行结果进行逐步归因分析,识别错误累积的临界节点。其轨迹状态的显式标注进一步区分了正常完成、显式报错与工具调用中断三类终止情形,为智能体鲁棒性研究提供了可量化的观察窗口,对推动可解释、可验证的智能体评估范式具有实质意义。
衍生相关工作
围绕 WildClawBench 生态,已衍生出若干相互衔接的经典工作。WildClawBench 本体提供任务数据与四类执行框架的 Docker 镜像,构成评估的基准底座;WildClawBench-Harbor 将全部任务转译为 Harbor 格式,使任意受支持的智能体均可通过单条命令接入评估;本轨迹数据集则在其上补充了完整的前沿模型运行记录,三者形成从任务定义、标准化执行到轨迹分析的分层体系。相关研究依托该轨迹集合展开轨迹级行为建模与失败模式归纳,并持续随着排行榜新模型的加入而扩展,逐步构建起长程智能体评估的开放研究基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务