遇见数据集

QuoteBench-Rollouts

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

QuoteBench Rollout Records(quotebench-rollouts-1.0.0)是一个用于评估文本生成模型在命令行工具调用场景下安全性与鲁棒性的数据集。该数据集包含来自多个评估活动(campaign)的 12999 条模型生成记录,每条记录对应一次模型生成(rollout),并可在不同用户环境(BSD 或 GNU 工具链)和不同合约(raw、nested、native)下重放执行。数据按模型和活动分文件存储,每条记录包含模型标识、生成内容、停止原因、令牌使用统计、请求时间戳以及执行结果(包括 stdout/stderr 的脱敏版本)。数据集旨在支持对模型生成命令的可靠性、跨环境兼容性以及不同合约下安全性的比较分析。注意:该数据集包含一个 canary 字符串,禁止用于训练。

QuoteBench Rollout Records (quotebench-rollouts-1.0.0) is a dataset for evaluating the safety and robustness of text generation models in command-line tool invocation scenarios. It contains 12,999 model generation records from multiple evaluation campaigns, each corresponding to a single model rollout that can be replayed in different user environments (BSD or GNU toolchains) and under different contracts (raw, nested, native). Data is organized by model and campaign in separate files. Each record includes model identifier, generated content, stop reason, token usage statistics, request timestamp, and execution results (including sanitized versions of stdout/stderr). The dataset aims to support comparative analysis of model-generated command reliability, cross-environment compatibility, and safety under different contracts. Note: This dataset contains a canary string and is prohibited for training.

创建时间:
2026-08-07
原始信息汇总

数据集概述

QuoteBench Rollout Records(quotebench-rollouts-1.0.0) 是一个用于文本生成任务的英文数据集,采用 Apache-2.0 许可证。该数据集包含模型在命令行生成任务中的运行记录(rollout records),共 12,999 条记录,每条记录对应一次模型生成过程。数据集特别标注了“Canary”警告,禁止将其用于训练,以避免污染留出测试集。

数据组织与格式

  • 每行一个 JSON 对象,每个(活动组,模型)组合对应一个文件。
  • 提供 rollout-schema.json 作为字段级权威定义。
  • 每个“运行记录”(rollout)代表一次模型生成;同一回复可能在不同用户环境(userland)和不同合约(contract)下多次执行,每次执行记录在 executions 数组中,但不产生新的运行记录。

活动组(Campaigns)

  • raw-vs-nested:在同一服务窗口内交替比较两种协议的默认运行模式。
  • nested-effort-ladder:在提供商暴露的每个努力档位下运行嵌套协议。
  • raw-vs-native:比较原始协议与提供商原生 shell 工具,覆盖所有档位和两种用户环境。
  • raw-effort-ladder:在用于逐档交叉比较的测量努力档位下运行原始协议。

合约(Contracts)

  • raw:回复作为脚本参数直接传递给 shell,不经修改。
  • nested:回复被插入到外层命令的双引号内执行,需额外经过一层 shell 引号解析。
  • native:回复作为结构化工具调用的命令字段,由测试框架提取;该合约下无自由文本回答。sampling.contract 为模型提示时使用的合约,executions[].target_contract 为实际执行时使用的合约。

用户环境(Userlands)

  • bsdgnu:分别代表 BSD 和 GNU 两个主流标准命令行工具实现家族,同一命令会在两种环境下重放执行。

模型与停止原因

  • model.model_id 使用论文中报告的公开模型标识符。
  • response.finish_reason 标准化为三种值:
    • stop:正常结束。
    • length:因输出/上下文上限被截断,此类生成记为失败,不执行任何命令,失败类别为 generation-length
    • null:未报告停止原因。

其他字段说明

  • usage 使用稳定字段名:prompt_tokenscompletion_tokenstotal_tokenscompletion_tokens_details.reasoning_tokens;未报告的计数为 null,而非 0
  • timing.date 为请求的 UTC 日期(尽可能精确到天)。

数据脱敏与格式

  • 捕获的 stdout/stderr 经过主机脱敏处理:机器名、搜索路径、沙箱工作目录等值分别替换为 <hostname><path><workdir>;模型生成的文本不会被改写。
  • 所有元数据字段仅允许使用已发布名称(如 raw/nested/nativebsd/gnu),且不包含文件系统路径。

构建验证门禁

数据集构建需满足以下条件:运行记录 ID 唯一;每个执行均对应真实运行记录;无违禁主机或操作系统元数据;仅使用已发布名称且无文件系统路径;每个模型标识符与声明的公开配置一致;所有 finish_reason 在词汇表中,且所有长度截断生成均记为失败且未执行命令。

私有数据说明

论文中报告的私有留出交叉、重复生成、临时脚本和类型化操作分析的记录级证据未包含在公开版本中,以保持防污染分割。

搜集汇总
数据集介绍
QuoteBench-Rollouts 数据集图片
构建方式
QuoteBench-Rollouts 数据集构建于对多种大语言模型在命令行交互场景下的系统评估。其核心单元为一次模型生成,即一个 rollout,每条记录为 JSON 格式,共包含 12999 条生成记录。数据集设计了四个实验活动(campaign),分别考察原始协议与嵌套协议的对比、嵌套协议在不同努力等级下的表现、原始协议与原生工具调用的对照,以及原始协议的努力阶梯。同一生成回复会在不同的用户环境(BSD 与 GNU)及不同的合同(原始、嵌套、原生)下进行重放,以模拟多样化的执行条件。所有记录均经过严格的门控校验,确保标识符唯一、元数据合规且不包含敏感信息,从而保障数据集的可靠性与防污染性。
使用方法
使用该数据集时,研究者可按活动、合同、用户环境或模型等维度进行筛选,以分析不同条件下模型生成的命令质量与执行成功率。每条记录中的'verdict'字段可直接用于监督式评估,而执行结果(stdout/stderr)可用于错误模式分析或二次标注。由于数据包含多合同交叉设计,研究者可借助同一生成在不同合同下的执行结果,探究提示策略与工具调用方式对模型行为的影响。该数据集适合用于基准测试、提示工程研究以及命令行任务中语言模型的鲁棒性分析,但需注意其禁止直接用于模型训练,以避免污染评估集。
背景与挑战
背景概述
QuoteBench-Rollouts数据集诞生于大语言模型(LLM)智能体安全评估领域,由研究团队于2024年创建,旨在系统性地探究模型生成命令在真实Shell环境中的鲁棒性与安全性。该数据集围绕'原始-嵌套'(raw-vs-nested)、'原始-原生'(raw-vs-native)等四种实验战役,模拟了模型输出在不同命令行接口(CLI)上下文中的执行场景,覆盖BSD与GNU两种用户态环境。其核心研究问题在于揭示模型生成内容在遭受Shell引用嵌套、工具调用等现实约束时,性能下降的规律与安全风险。通过公开12999条回放记录,该数据集为评估LLM在实际终端交互中的可靠性提供了标准化基准,对智能体系统设计、提示注入防御及安全对齐研究具有重要参考价值,推动了业界对模型'真实执行环境适配性'这一关键能力的关注。
当前挑战
该数据集直面多重挑战。领域层面,LLM生成命令在Shell中执行时需应对引用嵌套、转义规则等歧义性,极易引发注入或语法错误,而现有评估多忽略此类‘执行级’鲁棒性;数据集构建中,需确保同一回复在不同契约(原始、嵌套、原生)及用户态(BSD/GNU)下的公平回放,避免污染,因此严格实施金丝雀标识隔离、宿主信息脱敏及统一停止原因标准化。此外,长度截断被判定为失败,绝不执行,以真实反映生成质量;同时,私有保留数据的交叉验证设计,在公开性与防污染间取得平衡。这些技术难点考验着数据集的可信度与实用性,也为其后续扩展奠定了严苛标准。
常用场景
经典使用场景
QuoteBench-Rollouts数据集作为大语言模型(LLM)在命令行交互场景下鲁棒性评估的基准,其经典使用场景聚焦于对模型生成的shell命令在多样化执行环境中的跨合约、跨用户态的重放验证。该数据集精心设计了raw、nested与native三种交互合约,分别模拟指令直传、引号嵌套及原生工具调用等典型代理执行路径,同时跨越BSD与GNU两大主流用户态工具链,系统性地量化模型在应对上下文特异性脆弱性时的表现。研究者和开发者借助此数据集,能够精确剖析模型输出在真实调试、系统管理及自动化脚本执行中的性能边界,从而推动代理系统在复杂shell环境中的安全性与可靠性测试向标准化、可复现方向演进。
解决学术问题
该数据集直面大语言模型在代理式命令行任务中脆弱性的关键学术命题,尤其关注生成命令在不同执行后端与提示合约下表现出的性能变异。它通过引入跨合约交叉与多阶梯努力等级的实验范式,解决了以往研究因缺乏统一、防污染评测基准而难以客观比较模型鲁棒性的难题。数据集的精妙设计还解决了对长度截断、令牌分配及终止原因进行归一化标注的规范性缺失问题,为模型在真实shell工具链中的失败模式提供因果性证据,从而加深了对LLM工具使用泛化、任务泛化及环境迁移现象的理解,为揭示模型内部决策机制与外部环境交互机理奠定了实证基础。
实际应用
在实际应用层面,QuoteBench-Rollouts数据集为构建高可靠性的AI编程助手、智能运维代理及命令行自动化工具提供了不可或缺的验证支撑。工程技术团队可直接利用该数据集评估模型在Linux服务器管理、DevOps流水线脚本编写及嵌入式系统配置等任务中的执行安全性,提早识别人工智能代码生成在跨平台移植时的潜在故障。此外,它支持了代理系统开发中的回归测试与持续集成部署,确保模型迭代不损失对特定shell环境适配能力。该数据集的脱敏记录与规范化输出亦助力企业构建内部沙箱环境下的红队演练与提示注入防御体系,真正架起了模型能力评测通向生产环境落地的桥梁。
数据集最近研究
最新研究方向
QuoteBench-Rollouts数据集聚焦于大语言模型在命令行交互场景中的鲁棒性与安全评估,其前沿研究方向涵盖跨环境、跨协议的一致性测试与对抗性攻击防御。通过多臂随机试验设计(如raw-vs-nested、nested-effort-ladder等),该数据集支持对模型在嵌套引用、原生工具调用等复杂语义下的执行可靠性进行细粒度剖析,为构建更稳健的智能体系统提供了量化基准。其私有留存数据集与金丝雀标记机制,体现了对数据污染问题的前瞻性防范,推动了可复现、防泄漏的模型评估范式发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务