遇见数据集

modal-labs/autoinference-realtime-mix-v1

收藏
Hugging Face2026-06-17 更新2026-06-21 收录
官方服务:

资源简介:

这是一个用于real_time_generation服务基准测试的提示集,模拟中等上下文、单次交互流量:大约3000个输入标记和100个输出标记,每次请求独立,无共享上下文。与使用固定长度的随机标记ID不同,该数据集保持相同的输入和输出形状,但使用真实提示。真实文本很重要,因为随机标记会使推测解码看起来比实际更差,且无法反映真实流量的标记化方式。数据集包含450个请求,平均分为三类(每类150个),覆盖从结构化到非结构化文本:humaneval(代码,基于openai/openai_humaneval提示,包装在“完成这些函数”指令下)、cnn_dailymail(提取式QA,基于abisee/cnn_dailymail 3.0.0文章,包装在“总结”指令下)和wildchat(开放聊天,基于英语allenai/WildChat-1M对话轮次,扁平化处理)。每个请求使用真实文本块填充至约3000个标记,无跨请求的系统提示,以保持独立请求形态。如果文本超出范围,会在标记级别截断,确保所有请求在2700到3300个标记之间。WildChat部分仅保留标记为英语的对话,并删除包含CJK字符的内容。输入长度基于Qwen2.5标记器统计,不同模型可能略有差异。输出长度未包含在数据中,需通过基准测试限制(如100个标记)来匹配目标。数据格式为JSON,包含source、conversations(角色为user和assistant的对话列表)和input_tokens_qwen25字段。注意:HumanEval部分因只有164个问题而大量重用,但打包顺序随机化以避免前缀共享;如需更多代码多样性,可替换更大来源。构建脚本为autoinference仓库中的tools/build_realtime_dataset.py。

This is a prompt set for the real_time_generation serving benchmark. That profile stands in for medium-context, single-shot interactive traffic: roughly 3000 input tokens, 100 output tokens, one request at a time with no shared context between requests. The usual way to run it feeds the server random token IDs of a fixed length. This dataset keeps the same input and output shape but uses real prompts. The reason real text matters: random tokens make speculative decoding look worse than it is, because no draft model can predict noise, and they dont tokenize the way real traffic does. So a recipe with EAGLE3 or MTP can look identical to one without when you benchmark on random IDs. Real prompts give you a realistic acceptance length and a realistic token mix while staying in the same length band. The dataset contains 450 requests, split evenly three ways (150 each). The three sources span structured to unstructured text: humaneval (code, based on openai/openai_humaneval prompts packed under a complete these functions instruction), cnn_dailymail (extractive QA, based on abisee/cnn_dailymail 3.0.0 articles packed under a summarize instruction), and wildchat (open chat, based on English allenai/WildChat-1M conversation turns, flattened). Each request is its own block of real text packed up to about 3000 tokens. There is no system prompt shared across requests, which keeps the independent-request shape that real_time_generation is meant to model. When a piece of text would push a request past the band, it gets truncated at the token level so everything lands between 2700 and 3300 tokens. WildChat is multilingual, so this build keeps only conversations tagged English and drops anything that still contains CJK characters. Input length statistics are provided using the Qwen2.5 tokenizer, with variations expected for different models. Output length is not part of the data and should be capped by the benchmark (e.g., 100 tokens). The format is JSON with fields: source, conversations (a list of role-user and assistant dialogues), and input_tokens_qwen25. Note: HumanEval section reuses problems due to limited count (164 problems), but packing order is shuffled; for more code variety, swap in a larger source. The build script is tools/build_realtime_dataset.py in the autoinference repo.

提供机构:
modal-labs
搜集汇总
数据集介绍
modal-labs/autoinference-realtime-mix-v1 数据集图片
构建方式
本数据集名为 Autoinference Real-Time Generation Mix v1,专为实时生成服务的延迟基准测试而设计。其构建方式旨在模拟中等上下文、单轮交互的流量模式:约3000个输入token与100个输出token,每次请求独立且无共享上下文。数据集包含450条请求,均匀取自三个来源:HumanEval(代码补全)、CNN/DailyMail(摘要式问答)和WildChat(开放式英文对话)。每条请求通过真实文本填充至2700至3300个token区间,超出部分在token级别截断,确保输入长度一致。对于WildChat的多语言特性,仅保留英文对话并剔除含CJK字符的内容。数据以JSONL格式存储,每条记录包含来源、多轮对话结构及token计数。
使用方法
使用该数据集时,可直接将其作为sglang基准测试的输入,通过指定`--dataset-name custom`参数加载。数据中的`conversations`字段遵循ShareGPT格式,引擎自动取第一轮用户输入作为生成提示,占位符的助手回复被忽略,实际生成长度由基准测试的`--sharegpt-output-len 100`等参数决定。若需调整数据构成,可使用autoinference仓库中的`tools/build_realtime_dataset.py`脚本,通过设置不同随机种子或调整各来源请求数量重新生成。需注意HumanEval仅有164个问题,150条代码请求会多次复用同一问题,但每次打乱顺序以确保前缀不同。如需增加代码多样性,可替换为更大规模的代码数据集。
背景与挑战
背景概述
Autoniference-RealTime-Mix-v1 数据集于 2023 年发布,由相关团队基于对大型语言模型服务基准测试的深入研究而构建。该数据集聚焦于实时文本生成场景,模拟中等上下文、单次交互流量,每个请求包含约 3000 个输入 token 和 100 个输出 token,以填补现有基准测试中使用随机 token 导致的评估失真问题。其研究核心在于提供真实文本提示,使推测性解码等技术在延迟和吞吐量评估中能展现实际性能,避免随机 token 带来的偏差。该数据集集成来自 HumanEval(代码)、CNN/DailyMail(摘要)和 WildChat(开放聊天)三种异构来源的 450 个请求,已在 SGLang 等推理系统基准测试中广泛应用,显著影响了 LLM 服务性能评估的可靠性。
当前挑战
在领域问题层面,该数据集解决了现有 LLM 服务基准测试中随机 token 无法反映真实流量特性的挑战,特别是推测性解码技术因无法预测噪声而表现失真,以及 token 分布与实际场景不符的问题。构建过程中面临多项挑战:首先,数据来源需保持输入长度在 2700–3300 token 范围,这需要通过 token 级别截断实现精确控制;其次,HumanEval 仅有 164 个问题,导致 150 个代码请求高度重复,需通过随机打乱顺序避免前缀重叠;此外,WildChat 为多语言数据,需过滤非英文及包含 CJK 字符的对话以保持一致性,同时确保无共享系统提示以维持独立请求模型。
常用场景
经典使用场景
Autoinference Real-Time Mix v1数据集专为服务端实时文本生成场景的延迟基准测试而设计,其核心应用在于模拟中等上下文长度、单次交互的实时推理负载。该数据集精心构建了450条真实文本请求,每条包含约3000个输入token与100个输出token,分别来源于代码补全(HumanEval)、摘要式问答(CNN/DailyMail)和开放式聊天(WildChat)三种风格各异的真实文本源,覆盖了从结构化到非结构化的典型生成任务。在评测过程中,研究者可直接将其导入支持该数据集格式的推理框架(如SGLang),通过设定输出长度上限来精确控制生成步数,从而有效地评估不同服务系统在真实流量下的端到端响应延迟与吞吐性能。
解决学术问题
该数据集解决了传统服务端基准测试中普遍存在的一个关键学术问题:使用随机token ID代替真实文本进行性能评估时,会导致投机解码(Speculative Decoding)等加速技术的收益被严重低估。由于随机序列不可压缩且缺乏语义结构,无草稿模型能够有效预测其后续token,这使得EAGLE3、MTP等依赖于文本统计规律的方法在随机基准测试中表现与朴素模型无异,从而掩盖了其在实际应用中的真实加速效果。Autoinference Realtime Mix v1通过引入真实文本,使得衡量指标如接受长度(Acceptance Length)和token分布更加符合实际部署场景,为投机解码、推测性采样等加速策略提供了更加公平且可复现的评估平台,推动了生成式推理系统的科学评估方法向前发展。
实际应用
在实际工业应用中,该数据集直接服务于大语言模型推理服务的性能调优与容量规划。云服务提供商和模型部署团队可使用此数据集构建接近真实用户行为的负载测试工具,例如评测在3000 token上下文的请求下,不同批处理策略、KV Cache管理、模型量化级别以及高端GPU(如H100、A100)与低延迟网络架构组合时的尾延迟和每秒处理请求数。这使得基于延迟敏感型SLA(如响应时间在500毫秒内)的设计决策有了可靠的依据。此外,该数据集还适用于对比不同推理引擎(如vLLM、TensorRT-LLM、SGLang)在混合负载下的表现,以及在数据集规模的扩展过程中(通过调整种子或各源数量),帮助工程团队系统性地识别系统瓶颈并验证优化手段的有效性。
数据集最近研究
最新研究方向
在实时文本生成服务基准测试领域,该数据集聚焦于突破传统随机Token基准的局限,通过引入真实文本提示(涵盖代码、摘要提取与开放对话三类结构化程度各异的语料),为推测性解码等前沿加速技术提供更贴近实际部署场景的评估环境。此举回应了大语言模型推理优化中因随机输入导致的性能失真问题,尤其揭示了EAGLE3、MTP等草案模型在真实Token分布下的接受长度差异,推动业界重新审视服务延迟指标的可靠性。结合SGLang等推理框架的集成,该数据集已成为衡量中上下文、单次交互流量下模型服务水平协议(SLA)的关键工具,其影响延伸至边缘部署与实时应用优化的热点方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务