遇见数据集

syfi_coding_trace

收藏
github2026-06-13 更新2026-06-20 收录
数据链接:
官方服务:

资源简介:

TraceLab是一个开放工具包和公共数据集中心,专注于收集、清理、分析和可视化智能体交互轨迹。它提供了一个经过清理的多用户轨迹数据集,包含JSONL和DuckDB格式的文件,涵盖来自Claude和Codex等提供商的357,161行数据、432,510条工具记录和43个不同的匿名用户,用于研究和实验目的。

TraceLab is an open toolkit and public dataset hub dedicated to collecting, cleaning, analyzing, and visualizing agent interaction trajectories. It provides a cleaned multi-user trajectory dataset in JSONL and DuckDB formats, which contains 357,161 data rows, 432,510 tool records, and 43 distinct anonymous users from providers such as Claude and Codex, intended for research and experimental purposes.

创建时间:
2026-06-13
原始信息汇总

TraceLab 数据集详情

数据集概述

TraceLab 是一个开放的通用工具包和公共数据集中心,用于收集、清洗、分析和可视化智能体交互轨迹。

数据集内容

  • 数据集格式:标准化的 JSONL 格式轨迹文件
  • 行数:357,161 行
  • 工具记录数:432,510 条
  • 不同匿名用户数:43 个
  • 数据提供方
    • Claude:140,338 条
    • Codex:216,823 条

数据字段

每条 JSONL 行对应一次 LLM 调用,包含以下主要字段:

  • 顶层字段:provider/session ID、模型、输入/输出 token 数量、缓存前缀拆分、来源存储、timing_eventstrace_key
  • timing_events[]:按顺序排列的轨迹观察事件列表,包含 user_messagetool_resultreasoningtexttool_call、Codex usage_report
  • tools[]:包含 tool_nametool_call_idemitted_atinput_charsresult_charstool_wall_latency_mstool_internal_latency_msis_errorresult_at
  • Token 字段归一化input_tokens_total = prefix_tokens + newly_append_tokens
  • 工具延迟字段
    • tool_wall_latency_ms:轨迹观察的墙钟延迟
    • tool_internal_latency_ms:工具/运行器报告的持续时间

数据下载

数据集通过 GitHub Release 发布,包含以下资源:

  • JSONL 文件syfi_coding_trace.jsonl.gz
  • DuckDB 文件syfi_coding_trace.duckdb
  • Release 标签v2026-06-08-syfi-trace
  • 校验和
    • JSONL SHA256:9d265eae69a31cae203848bea936f018148eed7ca8bf56050c5abe96da0b4e6b
    • DuckDB SHA256:5d2ef12486cdfc26d770e8432fb45fd17381377be739a4d8e5b8556587721507

数据处理流程

1. 数据收集

  • collect_llm_traces.py:扫描 Claude/Codex 本地历史记录,生成归一化的轮次轨迹
  • extract_claude_rounds.py / extract_codex_rounds.py:将 provider JSONL 会话转换为归一化轮次行

2. 数据清洗

  • sanitize_round_trace.py:移除公开发布敏感字段,重写标识符为稳定伪随机替换

3. 分析实验

分析实验位于 artifacts/<category>/<experiment>/ 目录下,每个实验包含:

  • README.md:说明问题定义和度量定义
  • 分析/绘图脚本
  • 生成的输出文件(PNG/CSV/JSON/MD)

主要分析类别:

  • trace_facts:轨迹事实概览
  • llm_generation:LLM 生成分析(前缀追加分布、生成时间 CDF、时序拟合)
  • tool_calls:工具调用分析(工具延迟分布)
  • prefix_cache:前缀缓存分析
  • human_in_the_loop:人在回路分析
  • session:会话分析

4. 验证与审计

验证器位于 validators/<category>/<validator>/ 目录下,生成 Markdown/CSV 报告:

  • human_in_the_loop 类别
  • trace_facts 类别

项目结构

  • scripts/:数据流水线(收集、提取、清洗)
  • docs/:跨实验的方法论说明
  • trace/:生成的归一化 JSONL 轨迹
  • artifacts/:分析与绘图实验
  • validators/:验证与审计检查
  • example_sessions/:小型公开扩展轨迹示例及人工解释
搜集汇总
数据集介绍
syfi_coding_trace 数据集图片
构建方式
syfi_coding_trace数据集源自UW SYFI实验室的TraceLab项目,旨在系统性地收集、清洗、分析并可视化智能体交互轨迹。该数据集的构建依托于一套完整的流水线:首先通过collect_llm_traces.py脚本扫描本地Claude与Codex的历史会话记录,提取归一化的回合级轨迹,并以JSONL格式存储。随后利用sanitize_round_trace.py工具对敏感信息进行脱敏处理,将会话、轮次、用户等标识符替换为稳定的伪随机值,同时移除本地路径与工具输入等隐私字段,仅保留输入字符长度等统计要素。最终生成包含357,161行记录、432,510条工具调用及43个匿名用户的公开脱敏版本,并同时提供预构建的DuckDB数据库以支持高效分析。
特点
该数据集最显著的特点在于其细粒度的调用级记录与全面的元数据覆盖。每条JSONL行对应一次大语言模型调用,精确记录了输入输出令牌数、缓存前缀拆分情况、有序时间事件列表(包含用户消息、工具结果、推理过程等阶段)以及嵌套的工具调用元数据,如工具名称、调用标识符、延迟时长与执行状态。特别地,工具延迟被拆分为观测到的壁钟延迟与工具内部报告延迟两个字段,为性能分析提供双重维度。此外,数据集支持Claude与Codex两大提供商的对比分析,并保留了43个匿名用户的独立轨迹,使得跨用户行为模式的挖掘成为可能。
使用方法
使用syfi_coding_trace数据集通常从下载预发布的压缩JSONL文件或DuckDB文件开始,通过GitHub Release获取并校验完整性。对于细粒度统计分析,可直接加载JSONL文件运行analysis目录下的自包含实验脚本,例如使用overview_summary获取整体聚合事实,或通过tool_latency_distribution与generation_time_cdf模块分别探究工具延迟与生成时间的分布特征。分析脚本默认从trace/llm_round_trace.jsonl读取数据,并支持通过命令行参数指定输入路径、分组方式(如按用户或工具)及样本规模。对于需要导出自定义视角的研究者,可利用csv_export模块将轨迹数据转化为表格格式,便于在外部统计环境中进一步探索。
背景与挑战
背景概述
Syfi Coding Trace数据集由华盛顿大学SYFI实验室于2026年6月发布,核心研究人员围绕大规模编程智能体的行为追踪展开探索。该数据集聚焦于记录Claude与Codex智能体在真实编程任务中的交互轨迹,包含超过35万轮LLM调用记录、43万余条工具调用数据,覆盖43个匿名用户。其诞生旨在为智能体交互的可视化、分析与异常检测提供标准化工具链与公开基准,通过开源TraceLab框架实现从数据采集、脱敏到分析的完整流水线。该数据集对智能体行为研究领域具有奠基性意义,为理解LLM在复杂编程场景中的实际决策范式、工具使用模式及缓存策略提供了前所未有的细粒度实证基础,有力推动了智能体系统可观测性的理论发展与实践落地。
当前挑战
该数据集面临的挑战首要在于解决智能体交互行为建模的领域难题:传统日志分析难以捕捉LLM的上下文推理链条与工具调用依赖关系,而Syfi Coding Trace通过标准化时间线事件字段与双重延迟指标,力求在保留执行因果性的同时实现跨场景对比。构建过程中面临的挑战则显得尤为复杂:需从Claude/Codex本地历史中安全提取结构化轨迹,通过伪随机替代策略脱敏会话、用户及路径标识符,同时丢弃敏感工具输入字段以保障隐私;此外,还需协调357161行异构记录的格式一致性,确保token计数遵从'输入总量=前缀令牌+新增令牌'的归一化规则,并在43个用户的分布不均数据中维持工具调用频率、前缀缓存命中率等指标的统计无偏性。
常用场景
经典使用场景
在大型语言模型(LLM)与软件工程交叉领域,智能体交互轨迹的细粒度分析已成为理解模型行为模式的核心挑战。syfi_coding_trace数据集专为捕捉和规范化Claude与Codex等编码智能体的完整交互过程而设计,其经典使用场景聚焦于对LLM调用轮次、工具调用序列、缓存前缀利用效率及人类介入模式的系统性剖析。研究者可通过该数据集解析每个LLM调用的输入输出令牌分布、时序事件链及工具延迟特征,从而揭示模型在真实编程任务中的决策路径与资源消耗规律。
实际应用
在工业级编码助手的实际部署中,syfi_coding_trace的应用场景覆盖性能监控、资源规划与用户体验优化。工程团队可基于该数据集中的工具延迟分布与生成时间累积分布函数,识别外部API调用的瓶颈环节;通过分析缓存前缀命中率的变化规律,设计更高效的上下文缓存策略以降低推理成本;借助人类介入轨迹的统计特征,优化智能体自主决策的触发时机与回退机制。此外,该数据集支持的匿名化追溯能力,使开发者能够在保护隐私的前提下,对生产环境中不同提供商(Claude与Codex)的行为差异进行量化对比。
衍生相关工作
围绕syfi_coding_trace数据集已衍生出一系列具有方法论价值的经典工作,包括时序拟合分析工具、工具重复审计校验器以及交互段代表性样本提取算法。其中,时序拟合实验构建了从原始时序事件到生成区间的自动化映射管线,通过collect_timing_fit_trace脚本将LLM轮次中的用户消息、工具结果与推理事件对齐,为后续的延迟根因分析提供了精确的时间轴基准。另一项代表性工作是前缀缓存分析实验,它基于缓存创建令牌数与新增追加令牌数的归一化字段,推导出KV活性比率与增长桶等复合指标,推动了提示高效缓存策略的理论化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务