QuoteBench-Rollouts
收藏资源简介:
QuoteBench Rollout Records(quotebench-rollouts-1.0.0)是一个用于评估文本生成模型在命令行工具调用场景下安全性与鲁棒性的数据集。该数据集包含来自多个评估活动(campaign)的 12999 条模型生成记录,每条记录对应一次模型生成(rollout),并可在不同用户环境(BSD 或 GNU 工具链)和不同合约(raw、nested、native)下重放执行。数据按模型和活动分文件存储,每条记录包含模型标识、生成内容、停止原因、令牌使用统计、请求时间戳以及执行结果(包括 stdout/stderr 的脱敏版本)。数据集旨在支持对模型生成命令的可靠性、跨环境兼容性以及不同合约下安全性的比较分析。注意:该数据集包含一个 canary 字符串,禁止用于训练。
QuoteBench Rollout Records (quotebench-rollouts-1.0.0) is a dataset for evaluating the safety and robustness of text generation models in command-line tool invocation scenarios. It contains 12,999 model generation records from multiple evaluation campaigns, each corresponding to a single model rollout that can be replayed in different user environments (BSD or GNU toolchains) and under different contracts (raw, nested, native). Data is organized by model and campaign in separate files. Each record includes model identifier, generated content, stop reason, token usage statistics, request timestamp, and execution results (including sanitized versions of stdout/stderr). The dataset aims to support comparative analysis of model-generated command reliability, cross-environment compatibility, and safety under different contracts. Note: This dataset contains a canary string and is prohibited for training.
数据集概述
QuoteBench Rollout Records(quotebench-rollouts-1.0.0) 是一个用于文本生成任务的英文数据集,采用 Apache-2.0 许可证。该数据集包含模型在命令行生成任务中的运行记录(rollout records),共 12,999 条记录,每条记录对应一次模型生成过程。数据集特别标注了“Canary”警告,禁止将其用于训练,以避免污染留出测试集。
数据组织与格式
- 每行一个 JSON 对象,每个(活动组,模型)组合对应一个文件。
- 提供
rollout-schema.json作为字段级权威定义。 - 每个“运行记录”(rollout)代表一次模型生成;同一回复可能在不同用户环境(userland)和不同合约(contract)下多次执行,每次执行记录在
executions数组中,但不产生新的运行记录。
活动组(Campaigns)
- raw-vs-nested:在同一服务窗口内交替比较两种协议的默认运行模式。
- nested-effort-ladder:在提供商暴露的每个努力档位下运行嵌套协议。
- raw-vs-native:比较原始协议与提供商原生 shell 工具,覆盖所有档位和两种用户环境。
- raw-effort-ladder:在用于逐档交叉比较的测量努力档位下运行原始协议。
合约(Contracts)
- raw:回复作为脚本参数直接传递给 shell,不经修改。
- nested:回复被插入到外层命令的双引号内执行,需额外经过一层 shell 引号解析。
- native:回复作为结构化工具调用的命令字段,由测试框架提取;该合约下无自由文本回答。
sampling.contract为模型提示时使用的合约,executions[].target_contract为实际执行时使用的合约。
用户环境(Userlands)
- bsd 和 gnu:分别代表 BSD 和 GNU 两个主流标准命令行工具实现家族,同一命令会在两种环境下重放执行。
模型与停止原因
model.model_id使用论文中报告的公开模型标识符。response.finish_reason标准化为三种值:stop:正常结束。length:因输出/上下文上限被截断,此类生成记为失败,不执行任何命令,失败类别为generation-length。null:未报告停止原因。
其他字段说明
usage使用稳定字段名:prompt_tokens、completion_tokens、total_tokens、completion_tokens_details.reasoning_tokens;未报告的计数为null,而非0。timing.date为请求的 UTC 日期(尽可能精确到天)。
数据脱敏与格式
- 捕获的
stdout/stderr经过主机脱敏处理:机器名、搜索路径、沙箱工作目录等值分别替换为<hostname>、<path>、<workdir>;模型生成的文本不会被改写。 - 所有元数据字段仅允许使用已发布名称(如
raw/nested/native、bsd/gnu),且不包含文件系统路径。
构建验证门禁
数据集构建需满足以下条件:运行记录 ID 唯一;每个执行均对应真实运行记录;无违禁主机或操作系统元数据;仅使用已发布名称且无文件系统路径;每个模型标识符与声明的公开配置一致;所有 finish_reason 在词汇表中,且所有长度截断生成均记为失败且未执行命令。
私有数据说明
论文中报告的私有留出交叉、重复生成、临时脚本和类型化操作分析的记录级证据未包含在公开版本中,以保持防污染分割。





