遇见数据集

semianalysisai/cc-traces-weka-with-subagents-052726-256k

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

CC Traces — Weka, With Subagents, in+out ≤ 256k (May 27 2026, deduped) 是一个256k上下文模拟语料库,源自cc-traces-weka-with-subagents-052726数据集。该数据集经过过滤和去重处理:删除了每个请求(主代理和子代理内部)中输入加输出超过256,000代理标记符的条目,并重新调整了时间线以消除因删除请求而产生的间隙。数据集包含470条轨迹、51,739个主轮次、1,053个子代理组和26,119个子代理内部请求,总计77,858个模型请求。统计信息涵盖了标记符分布、轨迹跨度和模型组成(主要使用Claude模型如opus-4-7)。适用于文本生成、LLM推理、基准测试和多轮代理对话等任务。

CC Traces — Weka, With Subagents, in+out ≤ 256k (May 27 2026, deduped) is a 256k-context simulation corpus derived from the cc-traces-weka-with-subagents-052726 dataset. It has been filtered and deduped: every individual request (main-agent and sub-agent inner) where input plus output exceeds 256,000 proxy-tokenizer tokens has been dropped, and the request timeline is reshifted to collapse gaps created by removed requests. The dataset includes 470 traces, 51,739 main turns, 1,053 sub-agent groups, and 26,119 sub-agent inner requests, totaling 77,858 model requests. Summary statistics cover token distributions, trace spans, and model composition (primarily Claude models such as opus-4-7). It is suitable for text generation, LLM inference, benchmarking, and multi-turn agentic conversations.

提供机构:
semianalysisai
搜集汇总
数据集介绍
semianalysisai/cc-traces-weka-with-subagents-052726-256k 数据集图片
构建方式
本数据集源自于多智能体交互系统产生的原始日志,经过严格的筛选与重构流程,构建出一个专为256k长上下文模拟设计的语料库。原始数据经过代理端格式转换时已剔除约2%的精确重复行,随后对所有请求进行输入与输出令牌数总和不超过256,000的粒度过滤,舍弃超出阈值的主智能体与子智能体内部请求。对于子智能体组,若其所有内部请求均被过滤,则整体剔除;保留的部分则仅保留幸存请求。过滤后的请求时间线被重塑:首个幸存请求锚定在t=0,后续请求的时间依据前一个请求的API耗时与当前请求的思考间隔重新计算,子智能体内部请求同样遵循此规则,确保时间间隔连续无空洞。
特点
该数据集包含470条会话轨迹,涵盖51,739个主智能体轮次、1,053个子智能体组及26,119个子智能体内部请求,总计77,858个模型请求。请求的输入状态长度中位数为119,012令牌,输出序列长度中位数为285令牌,输入输出总和中位数为119,583令牌,最高可达255,996令牌。每条轨迹包含的条目数中位数为90,轨迹时间跨度的中位数约2,514秒,最长可达706,583秒。数据集中模型请求高度集中于Claude系列,其中claude-opus-4-7占比超过91%,展现出典型的多智能体协作与长上下文推理场景的分布特性。
使用方法
本数据集适用于大语言模型推理性能基准测试,特别是针对长上下文场景下的KV缓存优化与多轮对话系统评估。用户可直接加载traces.jsonl文件,每条记录包含完整的时间戳、模型标识、令牌计数等字段,便于复现请求序列的时间分布。数据集的令牌级粒度支持精确的上下文窗口压力测试,而重塑后的时间线可用于模拟实际推理系统中的请求调度与资源分配。推荐结合代理级工作负载生成器(如proxy-to-weka工具套件)进一步分析子智能体协作模式对推理延迟与吞吐量的影响。
背景与挑战
背景概述
随着大型语言模型在代理式多轮对话场景中的广泛应用,其推理过程中的键值缓存管理已成为系统优化的核心瓶颈。为模拟真实环境中高并发、长上下文推理的负载特征,SemiAnalysis团队于2026年5月创建了cc-traces-weka-with-subagents-052726-256k数据集。该数据集从原始代理交互轨迹出发,通过严格的令牌长度过滤与时间轴重对齐技术,生成了包含470条轨迹、逾7.7万次模型请求的高保真基准语料。其核心研究问题在于量化并复现256k上下文窗口下主代理与子代理间的复杂交互模式,为KV缓存调度算法与推理系统设计提供了关键支撑,在LLM推理性能评估领域具有里程碑意义。
当前挑战
该数据集所解决的领域挑战聚焦于长上下文推理场景中代理式系统的行为模拟与性能评测。一方面,现有基准多局限于单轮或短序列生成,难以刻画多层级、多轮次代理协作中上下文窗口的爆发式增长对缓存容量的压力;另一方面,原始轨迹存在请求长度超标、重复记录等数据瑕疵,需设计精确的256k令牌边界过滤机制,并创新性地采用时间轴重对齐策略消除因截断请求导致的时序空洞,确保轨迹的连贯性与统计有效性。构建过程中还面临子代理组部分失效后的组级完整性维护难题,以及去重操作对约2%原始行的剔除,这些技术挑战的解决共同保障了数据集的实用性与可靠性。
常用场景
经典使用场景
cc-traces-weka-with-subagents-052726-256k数据集专为长上下文大语言模型的推理性能评估而构建,其核心价值在于模拟真实世界中多智能体协作场景下的高并发请求流。该数据集收录了包含主智能体与子智能体交互的完整会话轨迹,并经过严格的token长度过滤,确保每条请求的输入输出总和不超过256k tokens。它广泛应用于KV-cache优化、推理引擎延迟分析以及长序列生成任务的基准测试,为衡量LLM在复杂多轮对话和子任务委派场景中的表现提供了标准化测试床。
解决学术问题
该数据集精准回应了当前大语言模型研究中的关键瓶颈:如何在多智能体协作且上下文窗口趋于极长的情况下,兼顾推理效率与资源消耗。它解决了传统基准测试仅关注单轮或短上下文交互的局限性,使学者能够系统研究token级长序列下的注意力机制退化、缓存策略失效及请求调度瓶颈。通过提供去重后且时间线重对齐的真实会话轨迹,该数据集推动了关于推理过程中内存占用、延迟分布与子任务并行性的定量分析,显著深化了对代理型LLM系统可扩展性的理解。
衍生相关工作
该数据集衍生了一系列标志性工作:其原始版本cc-traces-weka-with-subagents被用于验证多级缓存分层策略在200k+上下文场景下的吞吐量增益;后续研究基于其时间线重对齐方法,提出了动态请求预取与子智能体生命周期管理框架。部分工作聚焦于利用该数据集训练预测性调度模型以优化推理集群的负载均衡,还有学者借助其去重机制开发了针对代理流量中冗余模式的消歧算法。这些成果共同推动了LLM推理系统中请求粒度建模的理论与实践进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务