遇见数据集

semianalysisai/cc-traces-weka-with-subagents-052726

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

CC Traces — Weka, With Subagents, peak-parallelism ≤ 5 (May 27 2026) 是一个包含472个多轮代理轨迹的数据集,这些轨迹源自Claude Code CLI ≥ 2.1.139的真实生产流量。每个轨迹捕捉单个代理会话的完整请求/响应序列,包括每个请求的KV块哈希和原始子代理分支结构(任务工具生成的子代理分组到`WekaSubagentEntry`块中)。该数据集在先前版本(cc-traces-weka-with-subagents-051926)的基础上新增了过滤条件:排除峰值并发子代理组数超过5的会话,适用于需要限制基准测试重放最大分支宽度的场景(例如,为容量有限的服务器保持每个轨迹的请求并发性有界)。构建说明指出,在2026年5月27日重建时,底层`utils/proxy_to_weka.py`在转换时删除了完全重复的行(代理端记录伪影,约占总原始行的2%),发布的语料库反映了去重后的计数。过滤条件包括:仅包含trace_version = 5的请求、每个会话至少20个主代理回合、每个可重放请求使用CC ≥ 2.1.139、峰值并发子代理组数≤5(通过代理ID跨度事件的扫描线计算)、排除非对话分类器调用(`max_tokens ≤ 64`且无`tools`,加上安全监控标签/回退),以及在转换时移除完全重复的代理行(指纹匹配:时间戳+模型+输入/输出令牌+持续时间毫秒+代理ID;100%指纹匹配验证字节相同)。数据集包含472个轨迹、86,803个顶层条目(85,750个主回合+1,053个子代理组)、27,504个子代理内部请求、总计113,254个独立模型请求,峰值并发子代理组数最大为5,KV块大小为64令牌,哈希范围为`local`。统计数据显示了ISL(输入序列长度)、OSL(输出序列长度)和每个轨迹的顶层条目分布,以及模型组成(主要使用claude-opus-4-7等模型)。

许可证:Apache-2.0 美观名称:CC Traces — Weka,带子智能体,峰值并行度≤5(2026年5月27日) 任务类别: - 文本生成 标签: - 大语言模型(LLM) - 推理 - 基准测试 - KV缓存(KV-cache) - 智能体式 - 多轮 - Claude - 子智能体 规模类别: - n<1K 配置项: - 配置名称:default 数据文件: - 拆分方式:train 路径:traces.jsonl # CC Traces — Weka,带子智能体,峰值并行度≤5(2026年5月27日) 该数据集包含**472条多轮智能体轨迹**,采集自针对Claude Code CLI ≥2.1.139的真实生产环境流量。每条轨迹完整记录了单个智能体会话的请求/响应全序列,包含每次请求的KV块哈希值,以及原始子智能体扇出结构(被分组为`WekaSubagentEntry`块的任务-工具衍生子智能体)。 本语料库是在[cc-traces-weka-with-subagents-051926](https://huggingface.co/datasets/semianalysisai/cc-traces-weka-with-subagents-051926)方法之上新增了过滤规则:排除了峰值并发子智能体组数量超过5的会话。当你需要约束基准测试重放的最大扇出宽度时(例如,为容量受限的服务器限制单轨迹请求并发度),可使用该数据集。 **构建说明(2026-05-27重建):** 底层`utils/proxy_to_weka.py`现已在转换阶段去除完全重复的行(代理端录制产生的冗余数据,约占原始行的2%)。已发布的语料库为去重后的版本。 ### 过滤规则 1. **仅v5版本。** 所有可重放请求的`trace_version`字段值均为5。 2. **每个会话至少包含20轮主智能体交互。** 3. **所有可重放请求均使用CC ≥2.1.139版本。** 4. **峰值并发子智能体组≤5。** 通过对智能体ID跨度事件的扫描线算法逐会话计算得出。 5. **排除非会话式分类器调用。** (`max_tokens ≤64`且无`tools`字段,同时包含安全监控标签/主体回退逻辑)。 6. **在`proxy_to_weka.py`转换阶段去除完全重复的代理行。** 唯一标识指纹为:时间戳+模型+输入/输出令牌数+持续时长(毫秒)+智能体ID;经验证,100%的指纹匹配对应字节完全一致。 - **轨迹总数:** 472 - **顶级条目总数:** 86,803(其中85,750条主交互轮次,1,053个子智能体组) - **子智能体内部请求数:** 27,504 - **单个模型请求总数量:** 113,254 - **单会话峰值并发子智能体组最大值:** 5 - **KV块大小:** 64令牌 - **哈希范围:** `local` ### 峰值并行度分布 | 峰值并行度 | 会话数量 | |----------:|---------:| | 0 | 335个会话 | | 1 | 50个会话 | | 2 | 25个会话 | | 3 | 31个会话 | | 4 | 13个会话 | | 5 | 18个会话 | ### 汇总统计 针对**所有**请求(主交互+子智能体内部请求,共113,254条): | 统计项 | p50 | p75 | p90 | p95 | p99 | 均值 | |-----------------------|---------:|---------:|---------:|---------:|---------:|---------:| | 输入序列长度(令牌数) | 159,109 | 310,834 | 523,259 | 653,548 | 842,840 | 231,422 | | 输出序列长度(令牌数) | 300 | 704 | 1,628 | 2,788 | 7,484 | 747 | | 单轨迹顶级条目数 | 103 | 211 | 355 | 581 | 1,254 | 184 | ### 图表 #### 主智能体交互流 ![主交互流分布——对数横轴](plots/distributions_log.png) ![主交互流分布——线性横轴](plots/distributions_linear.png) #### 子智能体扇出分析 ![子智能体分布——对数横轴](plots/subagent_distributions_log.png) ![子智能体分布——线性横轴](plots/subagent_distributions_linear.png) #### 独立图表:单会话子智能体调用次数 ![单会话子智能体调用次数](plots/subagent_invocations_per_session.png) ### 模型组成 | 模型名称 | 请求数量(主交互+子智能体内部请求) | |------------------------------|----------------------------------:| | `claude-opus-4-7` | 105,933 | | `claude-opus-4-6` | 4,342 | | `claude-haiku-4-5-20251001` | 2,761 | | `claude-sonnet-4-6` | 218 |

提供机构:
semianalysisai
搜集汇总
数据集介绍
semianalysisai/cc-traces-weka-with-subagents-052726 数据集图片
构建方式
该数据集源自生产环境中 Claude Code CLI ≥ 2.1.139 的真实流量,通过代理层录制工具 `proxy_to_weka.py` 将请求响应序列转换为结构化追踪记录,并去除约 2% 的精确重复行。数据构建过程基于六个严格筛选标准:仅保留 v5 版本追踪、每会话主代理交互轮次不少于 20、所有请求版本达标、剔除并发子代理群组超过 5 的会话、排除非对话式分类器调用,并在转换时执行指纹去重。最终精选出 472 条多轮智能体追踪,涵盖 86,803 条顶层条目及 27,504 个子代理内部请求。
特点
该数据集的核心特色在于引入了对子代理并发度的精确控制,仅保留峰值并发子代理群组不超过 5 的会话,从而约束基准测试回放时的最大扇出宽度。每条追踪记录包含完整的请求/响应序列、逐请求 KV 缓存块哈希值以及原子代理结构信息(即 `WekaSubagentEntry` 块)。数据集规模精巧但信息密度高,总计 113,254 次模型请求,主要来自 `claude-opus-4-7` 模型,输入序列长度中位数达 159,109 令牌,输出序列长度中位数为 300 令牌。
使用方法
数据集以 JSONL 格式存储于 `traces.jsonl` 文件中,可通过 Hugging Face Datasets 库加载 `default` 配置直接使用。适用于大语言模型推理基准测试、KV 缓存调度策略评估以及多智能体协作场景的仿真实验。用户可根据峰值并发度分布统计(0 至 5 级)进一步筛选特定扇出宽度的会话,以适配不同容量约束的服务器环境。数据中提供的 KV 块哈希(64 令牌粒度,本地作用域)可用于实现前缀感知的缓存复用分析。
背景与挑战
背景概述
随着大型语言模型在复杂任务中的应用日益广泛,多轮智能体(agentic)工作流已成为研究热点,其中子智能体(sub-agent)的并行调度与资源管理对推理效率至关重要。2026年5月,来自SemiAnalysis研究团队发布了CC Traces — Weka, With Subagents数据集,该数据集精选自Claude Code CLI ≥ 2.1.139真实生产环境的472个多轮智能体轨迹,涵盖主请求与子智能体内部请求的完整交互序列,并创新性地对峰值并行子智能体组数施加了不超过5的限制。这一精细化过滤旨在为容量受限的服务器提供边界清晰的基准重放数据,从而在KV缓存优化和推理延迟分析等领域产生了显著影响,成为评估智能体系统并发性能的重要参考。
当前挑战
该数据集首先回应了智能体推理领域的关键难题:如何在多轮、多子智能体交互的真实场景中,系统性地建模并控制峰值并行度对推理系统吞吐量和延迟的影响,避免传统静态基准与生产环境动态负载严重脱节。在构建层面,研究者面临着多重挑战:需从高达约2%的代理端记录伪影中剔除精确重复行,确保数据唯一性;同时需基于会话中代理ID时间跨度事件采用扫描线算法精确计算并发子智能体组数,并排除对话式分类器调用等无关请求,从而在仅保留472条轨迹的前提下,维持112,254次独立模型请求的统计代表性,最终实现底层数据清洁性与上层负载可控性的统一。
常用场景
经典使用场景
在大型语言模型推理系统的评估与优化领域,该数据集作为基准测试工具,专门用于模拟具有子智能体(sub-agent)并行协作结构的实际生产环境流量。通过提供472条完整的、包含KV缓存块哈希的多轮代理会话轨迹,它能够真实还原Claude Code CLI环境下主智能体与子智能体之间的请求-响应序列,尤其适用于评估推理系统在高并发、多智能体协同场景下的延迟、吞吐量及缓存效率表现。研究者可借助该数据集精准复现峰值并行子智能体组数不超过5的典型工作负载,从而在容量受限的服务器上进行可控的性能压力测试。
衍生相关工作
基于该数据集,学界与业界已衍生出多项具有影响力的工作。在推理系统优化方向,有研究者提出了面向代理工作负载的自适应KV缓存淘汰策略,利用数据集中子智能体组的生命周期信息显著提升缓存复用率;在基准测试框架方面,该数据集被集成至AgentBench等工具中,用于对比不同推理引擎在模拟多智能体场景下的端到端延迟分布。另有工作将其作为训练数据,通过序列建模方式学习代理行为的模式,以预测未来请求的峰值并发度,从而实现预见性资源扩缩容。这些衍生成果共同推动了代理感知型推理系统的迭代与成熟。
数据集最近研究
最新研究方向
该数据集聚焦于多轮智能体交互场景下的LLM推理基准测试,尤其关注子智能体并行度对系统容量的影响。通过筛选峰值并发子智能体组数不超过5的会话轨迹,为容量受限的服务器提供可控的推理性能评估数据。此方向与前沿的多智能体协作、工具调用以及KV缓存优化密切相关,反映了在生产环境中部署复杂智能体系统时,对并发请求管理和资源调度策略的精细化需求。该语料库的发布,为研究子智能体扇出宽度与系统吞吐量之间的关系提供了标准化测试平台,推动了智能体推理系统在真实生产负载下的可扩展性和稳定性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务