bdd_scenarios
收藏资源简介:
该数据集由 META Brasil 内部使用,用于评估基于大语言模型(LLM)的 BDD(行为驱动开发)场景自动生成与评估流水线。数据集的构建目的是为服务 `bdd-eval-gen` 提供输入数据,该服务执行两个主要步骤:1)从每个用户故事(User Story)生成一个 Given/When/Then 格式的 BDD 场景;2)由 LLM 裁判对生成的场景进行 1 到 5 分的评分,并输出 JSON 格式的理由和推理链。数据集包含两个配置:`paper` 配置用于生成阶段,包含 `id`(唯一标识)、`user_story`(用户故事文本)和 `requirements`(需求描述)三个字段;`eval` 配置用于评估阶段,包含 `id`、`user_story`、`description`(或 `requirements` 作为后备)和 `bdd_ai`(或 `BDD-AI` 作为后备)字段,分别表示待评估的 BDD 场景。数据集采用 Gherkin 格式(葡萄牙语),每个场景包含一个“Cenário”(场景标题)以及 Dado(给定)、Quando(当)、Então(那么)步骤。所有数据均为内部使用,不对外公开分发,访问需要通过 HuggingFace 令牌并具有对 `metabrasil` 组织的读取权限。该数据集适用于 BDD 场景生成与评估的自然语言处理任务,以及 LLM 驱动的自动化测试流程基准测试。
This dataset is used internally by META Brasil to evaluate a pipeline for automatic generation and evaluation of BDD (Behavior-Driven Development) scenarios based on Large Language Models (LLMs). The dataset is designed to provide input data for the `bdd-eval-gen` service, which performs two main steps: 1) generating a Given/When/Then formatted BDD scenario from each User Story; 2) scoring the generated scenario from 1 to 5 by an LLM judge, outputting reasons and reasoning chains in JSON format. The dataset contains two configurations: the `paper` configuration for the generation phase, including fields `id` (unique identifier), `user_story` (user story text), and `requirements` (requirement description); the `eval` configuration for the evaluation phase, including fields `id`, `user_story`, `description` (or `requirements` as fallback), and `bdd_ai` (or `BDD-AI` as fallback), representing the BDD scenario to be evaluated. The dataset uses Gherkin format (in Portuguese), with each scenario containing a "Cenário" (scenario title) and steps Dado (Given), Quando (When), Então (Then). All data is for internal use only, not publicly distributed, and access requires a HuggingFace token with read permissions to the `metabrasil` organization. This dataset is suitable for NLP tasks of BDD scenario generation and evaluation, as well as benchmarking LLM-driven automated testing processes.
数据集概述:BDD Scenario Generation & Evaluation Benchmark
该数据集是由 META Brasil 构建的私有基准数据集,用于评估基于大型语言模型(LLMs)从 User Stories 自动生成和评估 BDD(Behavior-Driven Development)场景的pipeline。数据集是 bdd-eval-gen 服务的主要输入数据源。
核心用途
数据集的pipeline包含两个主要阶段:
- 生成阶段:基于每条需求(User Story)生成 Given/When/Then 格式的BDD场景(Gherkin语法,葡萄牙语)。
- 评估阶段:由LLM作为评判者,对生成的BDD场景进行1至5分的评分,并输出JSON格式的推理理由和思考链。
数据集配置(Configs)
数据集包含两个配置,对应pipeline的不同阶段:
| 配置名 | 阶段 | 加载方式 | 主要列 |
|---|---|---|---|
eval |
评估阶段 | 默认配置,load_dataset(hf, split="train") |
id, user_story, description(或requirements), bdd_ai(或BDD-AI) |
paper |
生成阶段 | load_dataset(hf, "paper", split="train") |
id, user_story, requirements |
eval配置被有意置于首位,因为评估阶段的loader不显式指定配置名称,HuggingFace会解析为README中列出的第一个配置。- 生成阶段配置必须命名为
paper,以匹配代码中的src/gen/gen_dataset.py。
数据模式(Schema)
配置 paper(生成阶段,split: train)
| 列名 | 类型 | 描述 |
|---|---|---|
id |
string | 需求的唯一标识符(例如 US-0001) |
user_story |
string | User Story文本,格式为 “Eu como … quero … para …” |
requirements |
string | 与User Story关联的描述/标准(为生成器提供上下文) |
配置 eval(评估阶段,split: train)
| 列名 | 类型 | 描述 |
|---|---|---|
id |
string | 需求的唯一标识符(与生成阶段使用的id相同) |
user_story |
string | 输入的User Story文本 |
description |
string | 输入的描述/标准(同样接受requirements作为后备) |
bdd_ai |
string | 待评估的生成BDD场景(同样接受BDD-AI作为后备) |
Pipeline输出
生成结果(GenResult,保存为 results/gen_<prompt_type>.csv)
| 列名 | 类型 | 描述 |
|---|---|---|
id |
string | 输入需求的相同id |
user_story |
string | 输入User Story的回显 |
description |
string | 输入requirements的回显 |
bdd_ai |
string | LLM生成的BDD场景,Gherkin格式(Cenário / Dado / Quando / Então) |
评估结果(EvalResult,保存为 results/eval_<prompt_type>.csv)
复用输入列,并添加以下列:
| 列名 | 类型 | 描述 |
|---|---|---|
rating |
int(1–5) | 评判者评分;失败时为null |
reasoning |
string | 详细理由(评判者返回的JSON格式) |
thinking |
string | 模型的推理链(reasoning_content),可用时提供 |
BDD场景格式要求
生成器产出单个“幸福路径”场景,使用Gherkin语法(巴西葡萄牙语):
Cenário: [场景名称] Dado [前置条件] Quando [操作] Então [预期结果]
可用的提示策略包括:zs(零样本)、fs(少样本)和cot(思维链)。
访问与使用
- 访问权限:该数据集为私有数据,需要HuggingFace token并对
metabrasil组织具有读取权限。 - 加载方式:使用
datasets.load_dataset("metabrasil/bdd_scenarios", ...),并根据阶段选择相应配置和split。 - 许可证:内部使用,不面向外部分发,访问受组织级token控制。
数据来源与上下文
User Stories为META Brasil内部BDD基准测试所整理。消费该数据集的pipeline(生成+评估+API)的代码存储在仓库 ceia-meta-bench-data 下的 services/bdd-eval-gen/ 目录中(GitHub仓库地址)。





