遇见数据集

tracelab-comprehend

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

tracelab COMPREHEND合成语料库是一个为研究长时程agent及其观察者而创建的数据集,与论文《Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers》(Pakhomov & Nijkamp, Salesforce AI Research; arXiv:2609.01466)一同发布。该数据集包含12个合成的长时程agent会话,总大小约11 MB,每个会话以Claude Code JSONL trace格式存储,包含工具调用及其结果、错误信息、文件接触记录以及会话元数据。所有数据均由生成器从种子201-212逐字节重现,确保完全可复现。数据分布具有现实性(工具调用频繁且包含错误),但不包含任何真实数据。该语料库用于支持论文中的COMPREHEND基准测试,其中监测问题从分类账真实情况(ground truth)机械生成,且分类账真实情况(包括轮次、顶级工具、文件、最新请求等)由生成器独立计算,与解析管道零偏差。数据许可证为CC-BY-4.0,生成器代码采用BSD-3-Clause许可证。该数据集适用于agent可观测性研究、长时程任务追踪、benchmark等场景。

The tracelab COMPREHEND synthetic corpus is a dataset created for studying long-horizon agents and their observers, released alongside the paper Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers (Pakhomov & Nijkamp, Salesforce AI Research; arXiv:2609.01466). It contains 12 synthetic long-horizon agent sessions, totaling approximately 11 MB, each stored in the Claude Code JSONL trace format, including tool calls and their results, error messages, file touch records, and session metadata. All data is reproduced byte-by-byte from seeds 201-212, ensuring full reproducibility. The data distribution is realistic (frequent tool calls with errors) but contains no real data. This corpus supports the COMPREHEND benchmark in the paper, where monitoring questions are mechanically generated from ledger ground truth, and the ledger ground truth (including rounds, top tools, files, latest requests, etc.) is independently computed by the generator with zero deviation from the parsing pipeline. The data is licensed under CC-BY-4.0, and the generator code is under BSD-3-Clause. The dataset is suitable for agent observability research, long-horizon task tracking, and benchmarking.

提供机构:
Salesforce
创建时间:
2026-08-22
原始信息汇总

数据集详情:tracelab COMPREHEND synthetic corpus

基本信息

  • 数据集名称:tracelab COMPREHEND synthetic corpus
  • 许可协议:CC-BY-4.0
  • 任务类别:文本生成(text-generation)
  • 语言:英语
  • 标签:智能体、轨迹、长时程、基准测试、智能体可观测性
  • 数据规模:小于 1K 条样本(n<1K)

数据集描述

该数据集包含 12 个由种子生成的合成长时程智能体会话,以 JSONL 事件流格式存储,总大小约 11 MB。数据集随论文 “Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers”(作者:Pakhomov & Nijkamp,Salesforce AI Research)一同发布,论文 arXiv 编号为 2609.01466。

内容特征

  • 每个文件代表一个会话,采用 Claude Code JSONL 轨迹格式,包含以下内容:
    • 工具调用及结果
    • 错误信息
    • 文件操作记录
    • 会话元数据
  • 数据生成时模拟了真实分布特征(工具调用密集、包含错误),但不包含任何真实数据
  • 数据集支持论文中可审计的 COMPREHEND 复制实验:监测问题由账本真值机械式生成。

可复现性

  • 数据集可通过随附的生成器(BSD-3-Clause 许可)逐字节完全相同地重新生成,使用种子编号 201–212,命令为:

    python -m tracelab.bench.synth_corpus --seeds 201-212

  • 轮次、主要工具、文件和最新请求的真值由生成器独立于解析管线计算,12 个会话中零不匹配

相关资源

  • 📄 论文:https://arxiv.org/abs/2609.01466
  • 💻 代码库(含生成器、基准测试和轨迹,BSD-3-Clause 许可):https://github.com/SalesforceAIResearch/tracelab
  • 🤗 数据集:本仓库(CC-BY-4.0 许可)

许可说明

  • 数据许可:CC-BY-4.0
  • 生成器代码许可:BSD-3-Clause
  • 数据集可由生成器逐字节重新生成,二者许可相互独立。
搜集汇总
数据集介绍
tracelab-comprehend 数据集图片
构建方式
该数据集源自Salesforce AI Research在长时程智能体观测领域的前沿探索,以论文《Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers》为依托,构建了一套合成会话语料库。其构建方式基于十二个预设随机种子(编号201至212),通过官方发布的生成器(tracelab)模拟生成事件流,每条记录严格遵循Claude Code的JSONL轨迹格式,涵盖工具调用、执行结果、错误反馈、文件操作及会话元数据等细粒度信息。生成过程确保数据在分布上具备真实感,即工具调用密集且伴随错误,但完全不包含真实数据,从而在保护隐私的同时满足科研复现的严苛要求。尤为关键的是,该语料库能够从种子中逐字节再生,保证了实验的绝对可复现性与审计透明度,为长时程智能体及其观测机制的研究提供了可靠的数据基石。
特点
该数据集的核心特质在于其合成性与可控性,将科研严谨性与现实复杂性巧妙融合。数据集的十二个会话均经过精心设计,呈现工具密集、错误频发的真实交互特征,同时摒弃了任何真实数据痕迹,规避了隐私泄露之虞。其独到之处在于,每个会话都附有由生成器独立计算的客观基准真值(如轮次、主要工具、涉及文件及最新请求),经全量验证与解析管线结果零误差匹配,这为模型评估提供了无偏且可审计的参照标准。此外,语料库体积适中(约11MB),且支持通过命令行实现逐字节复现,这一特性不仅增强了数据的可验证性,也为后续研究者在统一框架下扩展或调整数据规模提供了极大便利,彰显了其作为科研基准的典范价值。
使用方法
此数据集专为长时程智能体观测与分析的研究场景而设计,适用于训练与评估实时轨迹理解模型。研究者可直接获取JSONL格式的会话文件,进行事件流解析、工具调用序列分析或错误模式挖掘等任务。为便于基准测试,数据集配套了完整的代码库与工作台轨迹,覆盖了从数据生成到基准框架的全流程。用户可通过克隆GitHub仓库(tracelab)调用生成器模块,运行指定命令行即可精准重现语料,或按需调整种子参数以扩展数据集。在评估环节,数据集中预置的机械生成式问题与对应真值可作为监督信号,用于衡量解析模型在轮次识别、关键工具发掘及文件追踪等方面的性能。鉴于其CC-BY-4.0的宽松许可,该数据集亦支持学术研究与商业应用的多重用途,成为智能体观测技术发展的重要试验场。
背景与挑战
背景概述
随着大语言模型驱动的智能体在复杂任务中展现出日益强大的能力,对其长期运行轨迹进行实时监控与可观测性分析成为亟待攻克的前沿课题。在此背景下,Salesforce AI Research的Egor Pakhomov与Erik Nijkamp于2026年发布tracelab-comprehend合成语料库,旨在模拟真实智能体会话的分布特性,包括密集工具调用与高频错误场景,为长时域智能体及其观察者提供基准测试和可复现的研究环境。该语料库包含12条基于种子201至212生成的合成会话流,覆盖JSONL事件格式,并配套开源生成器,确保数据可完整再生,对智能体可观测性研究领域具有奠基性影响力。
当前挑战
面对的核心挑战在于,真实智能体轨迹数据难以获取且涉及隐私与安全约束,阻碍了可观测性研究的发展。构建过程中,需确保合成数据在统计特性上模拟真实分布的复杂性与噪声,同时规避敏感信息,实现分布真实性与数据纯净性的平衡。此外,验证生成轨迹与解析管线的独立一致性,保证零误差的基准质量,以及设计可用于训练监控模型的细粒度标注体系,均构成了严谨的技术与非平凡工程挑战。
常用场景
经典使用场景
该数据集的核心用途在于支撑长时程智能体(long-horizon agents)行为轨迹的结构化解析与语义理解研究。其提供的十二条种子化合成会话流,以事件流形式忠实记录了工具调用、执行结果、错误发生及文件触碰等细粒度操作序列,为研究者构建与验证实时轨迹解析模型(live trace models)提供了标准化、可复现的基准语料。经典使用场景聚焦于从原始轨迹流中自动抽取高层语义单元,如意图分段、关键决策点识别,以及任务状态追踪,从而推动Agent运行过程的可解释与可审计。
实际应用
在实际应用中,该数据及支撑其生成的工具链可深度赋能智能体监控与运维系统:开发人员能够据此训练实时异常检测模块,从事件流中即时识别工具调用失败或偏离主任务的异常模式;亦可构建任务进度可视化面板,自动归纳会话里程碑与待办事项。由于合成语料无敏感信息,它尤其适合作为CI/CD管道中的回归测试基准,确保解析更新不破坏既有功能。其剥离真实数据的设计也使其能够安全用于模型预训练,提升助手对长程人机协作交互的理解能力。
衍生相关工作
该语料衍生出一系列围绕智能体可观测性的后续研究脉络:一是基于其台账真值训练的监督式轨迹摘要生成模型,能够自动产出人类可读的执行日志;二是面向Agent轨迹的异常检测与根因分析框架,利用错误事件与文件触碰的耦合关系定位系统故障;三是无监督的会话分段与意图聚类算法,用于解析多目标长任务的结构层级。此外,其确定性生成器还催生了评估协议标准化工作,推动了跨机构基准测试的建立,使不同解析方案在同一语义锚点下可比对优劣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务