遇见数据集

modal-labs/autoinference-agentic-mix-v1

收藏
Hugging Face2026-06-17 更新2026-06-21 收录
官方服务:

资源简介:

Autoinference Agentic Mix v1是一个用于online_agentic服务基准测试的数据集,旨在模拟长视野代理流量,具有大上下文和短结构化输出的特点。数据集基于真实代理轨迹构建,数据源来自TIGER-Lab/SWE-Next-SFT-Trajectories,包含3,693个专家软件工程代理处理2,308个执行基础任务的轨迹。这些轨迹以工具使用循环形式呈现,代理通过读取文件、运行命令和编辑代码进行多轮交互。数据集包含451个请求,来自82个轨迹,每个请求具有至少34,000个输入令牌(平均38,269),输出令牌较短(平均151),以模拟代理在服务器上的前缀重用行为。数据集格式为每行一个JSON对象,包含消息、令牌计数和轨迹元数据。需要注意的是,数据集偏向成功轨迹,可能未充分代表失败或循环行为,且目前仅包含软件工程编码轨迹,但设计上允许未来扩展其他代理风格。

Autoinference Agentic Mix v1 is a dataset for the online_agentic serving benchmark, designed to simulate long-horizon agent traffic with large, growing context and short structured outputs per turn. It is built from real agent trajectories sourced from TIGER-Lab/SWE-Next-SFT-Trajectories, which includes 3,693 trajectories of expert software-engineering agents working on 2,308 execution-grounded tasks. These trajectories involve tool-use loops where agents read files, run commands, and edit code over multiple turns. The dataset consists of 451 requests derived from 82 trajectories, each with at least 34,000 input tokens (mean 38,269) and short output tokens (mean 151), replicating realistic agent prefix reuse on servers. The format is one JSON object per line, containing messages, token counts, and trajectory metadata. Note that the dataset is biased towards successful trajectories, underrepresenting failure and looping behavior, and currently focuses on software-engineering coding trajectories, with potential for future expansion to other agent styles.

提供机构:
modal-labs
搜集汇总
数据集介绍
modal-labs/autoinference-agentic-mix-v1 数据集图片
构建方式
该数据集源自TIGER-Lab/SWE-Next-SFT-Trajectories,即SWE-Next论文中的监督微调语料库,收录了3,693条由专家级软件工程智能体在2,308个基于真实合并拉取请求合成的执行任务中生成的轨迹。每条轨迹均表现为工具使用循环,智能体通过数十轮交互读取文件、运行命令与编辑代码。构建时,将每条轨迹转换为包含system、user、assistant及tool角色的对话,并将tool角色映射为user角色,以适配文本工具智能体循环的API调用方式。为模拟服务端多轮前缀复用,每条轨迹按助理发言轮次展开为独立请求,请求中保留截至该轮的历史对话,模型则生成下一轮助理回复。通过保留上下文超过34k令牌的尾部轨迹,最终筛选出451个请求,形成聚焦于长上下文的重型内容子集。
特点
该数据集专为online_agentic服务基准测试设计,模拟长周期智能体流量的典型特征——持续增长的上下文窗口与每次返回的简短结构化输出。其输入令牌均值达38,269,中位数为36,785,全部分布在34,024至61,278之间,呈现高度集中且偏大的特点;而输出令牌则极短,中位数仅59,契合智能体执行命令或代码编辑的场景。数据采用真实智能体轨迹而非合成前缀,使得前缀复用、上下文增长及令牌混合模式均精确匹配生产环境。来源为经筛选的成功轨迹,虽引入偏向性(排除失败与循环行为),但对延迟与吞吐量评估无实质影响。当前仅涵盖软件工程编码轨迹,未来计划扩展至客服工具循环或网页导航等风格,以丰富智能体交互多样性。
使用方法
数据集以每行一个JSON对象格式存储,可直接用于sglang的bench_serving --dataset-name openai命令或tools/replay_openai_trace.py脚本。每条记录包含messages字段(对话历史)、max_tokens(待生成的真实助理回复长度)、trajectory_id与turn_index(轨迹标识与轮次索引)、input_tokens_qwen25与output_tokens_qwen25(基于Qwen2.5分词器的令牌计数)及source(数据来源标识)。为复现多轮前缀复用效果,需按文件顺序发送请求,即可在服务端形成随轨迹逐步增长的共享前缀。用户可通过tools/build_agentic_dataset.py脚本调整--min-request-tokens参数及轨迹数量,按需生成不同长度分布或更大规模的数据子集。
背景与挑战
背景概述
在大型语言模型(LLM)的部署与推理优化领域,传统的服务基准测试(如静态文本生成)难以捕捉真实世界中智能体(agent)工作负载的独特特征。这些负载通常涉及长上下文、多轮交互以及结构化短输出,如工具使用循环中的命令生成或代码编辑。为此,AutoInference团队于2025年基于SWE-Next论文(arXiv 2603.20691)构建了autoinference-agentic-mix-v1数据集。该数据集源自TIGER-Lab/SWE-Next-SFT-Trajectories,包含3693条由专家软件工程智能体在2308个真实合并拉取请求(pull request)上执行任务时的轨迹,旨在替代传统随机令牌构造的共享前缀方法,提供更真实的智能体交互模式。该数据集聚焦于服务端推理基准测试,评估生成式模型在处理长上下文、多轮前缀复用及令牌混合时的性能,对LLM服务系统的吞吐量和延迟优化具有重要指导价值。
当前挑战
该数据集所解决的领域问题在于,现有服务基准多依赖随机令牌生成共享前缀,无法真实反映智能体工作负载中上下文增长、令牌分布及前缀复用模式,导致推理优化方案(如推测解码)在生产环境中效果失真。其构建过程面临多重挑战:首先,原始轨迹需从SWE-Next的监督微调语料中提取,但该语料仅包含成功任务轨迹,失败或循环行为(通常更长且重复性高)被排除,导致数据偏向于高效解决问题模式,无法全面覆盖智能体系统的异常行为。其次,数据集需将轨迹转换为符合基准工具要求的格式,包括将工具角色映射为用户角色以适配聊天模板,并以每个助手掌为单元拆分为独立请求,同时保持轨迹内的顺序以模拟前缀复用。此外,为了达到34k令牌以上的上下文要求,需筛选并扩展最长轨迹、舍弃早期短轮次,从而在有限来源中保留约451个高令牌量请求,而中位数约37k令牌,难以同时提升请求数量与上下文长度,需借助其他来源补充长轨迹。
常用场景
经典使用场景
在大型语言模型服务系统的性能评测领域,AutoInference Agentic Mix v1 数据集堪称一座里程碑式的基准资源。它专为模拟长期交互型智能体(Agent)的在线服务流量而设计,精准捕捉了工具调用场景下上下文逐轮膨胀、输出结构简洁且高度结构化的典型特征。借助从真实软件工程智能体轨迹中萃取的多轮对话,该数据集为评测系统在高上下文复用率、动态前缀增长以及混合 token 分布等生产环境关键指标上的表现,提供了无可替代的实测依据。
衍生相关工作
该数据集植根于 TIGER-Lab/SWE-Next-SFT-Trajectories 这一经过精心筛选的专家轨迹库,其构建方法论影响了后续多个关于 Agent 行为建模与服务评测的工作。研究界在借鉴其“真实轨迹而非随机前缀”的思路后,衍生出针对不同领域 Agent 流量的 Benchmark 扩展,例如客户服务工具循环和网页导航场景。同时,数据集对“成功轨迹偏差”的公开讨论——即倾向于保留成功解决任务的长序列,而低估了失败与循环行为的多样性——也启发了后续工作去构建更均衡的失败案例数据集,以全面评估系统在异常恢复模式下的鲁棒性。
数据集最近研究
最新研究方向
在当前大规模语言模型服务化部署的前沿探索中,长程智能体交互的基准测试正成为关键挑战。autoinference-agentic-mix-v1数据集应运而生,它从真实软件工程智能体轨迹中提炼,提供了451条基于82条完整专家级agent轨迹的高质量请求,每条请求均拥有超过34k tokens的庞大上下文前缀。这一构建精准模拟了生产环境中智能体逐步增长的上下文复用、短结构化输出以及工具调用循环,弥补了传统随机前缀生成方法的不足。该数据集基于SWE-Next论文中的SFT语料库,源自权威的代码库,涵盖2,308个由真实合并拉取请求转化的执行任务,因此其不仅服务于延迟与吞吐量的度量,更在地化了推测解码与标记化行为的表现。随着AI agent在软件开发、客户服务与网页导航等领域的广泛应用,该数据集为评估在线推理系统在长时间对话场景下的性能提供了前所未有的真实标尺,推动服务化基础设施向更贴近实际生产需求的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务