遇见数据集

bdd_scenarios

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集由 META Brasil 内部使用,用于评估基于大语言模型(LLM)的 BDD(行为驱动开发)场景自动生成与评估流水线。数据集的构建目的是为服务 `bdd-eval-gen` 提供输入数据,该服务执行两个主要步骤:1)从每个用户故事(User Story)生成一个 Given/When/Then 格式的 BDD 场景;2)由 LLM 裁判对生成的场景进行 1 到 5 分的评分,并输出 JSON 格式的理由和推理链。数据集包含两个配置:`paper` 配置用于生成阶段,包含 `id`(唯一标识)、`user_story`(用户故事文本)和 `requirements`(需求描述)三个字段;`eval` 配置用于评估阶段,包含 `id`、`user_story`、`description`(或 `requirements` 作为后备)和 `bdd_ai`(或 `BDD-AI` 作为后备)字段,分别表示待评估的 BDD 场景。数据集采用 Gherkin 格式(葡萄牙语),每个场景包含一个“Cenário”(场景标题)以及 Dado(给定)、Quando(当)、Então(那么)步骤。所有数据均为内部使用,不对外公开分发,访问需要通过 HuggingFace 令牌并具有对 `metabrasil` 组织的读取权限。该数据集适用于 BDD 场景生成与评估的自然语言处理任务,以及 LLM 驱动的自动化测试流程基准测试。

This dataset is used internally by META Brasil to evaluate a pipeline for automatic generation and evaluation of BDD (Behavior-Driven Development) scenarios based on Large Language Models (LLMs). The dataset is designed to provide input data for the `bdd-eval-gen` service, which performs two main steps: 1) generating a Given/When/Then formatted BDD scenario from each User Story; 2) scoring the generated scenario from 1 to 5 by an LLM judge, outputting reasons and reasoning chains in JSON format. The dataset contains two configurations: the `paper` configuration for the generation phase, including fields `id` (unique identifier), `user_story` (user story text), and `requirements` (requirement description); the `eval` configuration for the evaluation phase, including fields `id`, `user_story`, `description` (or `requirements` as fallback), and `bdd_ai` (or `BDD-AI` as fallback), representing the BDD scenario to be evaluated. The dataset uses Gherkin format (in Portuguese), with each scenario containing a "Cenário" (scenario title) and steps Dado (Given), Quando (When), Então (Then). All data is for internal use only, not publicly distributed, and access requires a HuggingFace token with read permissions to the `metabrasil` organization. This dataset is suitable for NLP tasks of BDD scenario generation and evaluation, as well as benchmarking LLM-driven automated testing processes.

创建时间:
2026-07-27
原始信息汇总

数据集概述:BDD Scenario Generation & Evaluation Benchmark

该数据集是由 META Brasil 构建的私有基准数据集,用于评估基于大型语言模型(LLMs)从 User Stories 自动生成和评估 BDD(Behavior-Driven Development)场景的pipeline。数据集是 bdd-eval-gen 服务的主要输入数据源。


核心用途

数据集的pipeline包含两个主要阶段:

  1. 生成阶段:基于每条需求(User Story)生成 Given/When/Then 格式的BDD场景(Gherkin语法,葡萄牙语)。
  2. 评估阶段:由LLM作为评判者,对生成的BDD场景进行1至5分的评分,并输出JSON格式的推理理由和思考链。

数据集配置(Configs)

数据集包含两个配置,对应pipeline的不同阶段:

配置名 阶段 加载方式 主要列
eval 评估阶段 默认配置,load_dataset(hf, split="train") id, user_story, description(或requirements), bdd_ai(或BDD-AI
paper 生成阶段 load_dataset(hf, "paper", split="train") id, user_story, requirements
  • eval 配置被有意置于首位,因为评估阶段的loader不显式指定配置名称,HuggingFace会解析为README中列出的第一个配置。
  • 生成阶段配置必须命名为 paper,以匹配代码中的 src/gen/gen_dataset.py

数据模式(Schema)

配置 paper(生成阶段,split: train)

列名 类型 描述
id string 需求的唯一标识符(例如 US-0001
user_story string User Story文本,格式为 “Eu como … quero … para …”
requirements string 与User Story关联的描述/标准(为生成器提供上下文)

配置 eval(评估阶段,split: train)

列名 类型 描述
id string 需求的唯一标识符(与生成阶段使用的id相同)
user_story string 输入的User Story文本
description string 输入的描述/标准(同样接受requirements作为后备)
bdd_ai string 待评估的生成BDD场景(同样接受BDD-AI作为后备)

Pipeline输出

生成结果(GenResult,保存为 results/gen_<prompt_type>.csv

列名 类型 描述
id string 输入需求的相同id
user_story string 输入User Story的回显
description string 输入requirements的回显
bdd_ai string LLM生成的BDD场景,Gherkin格式(Cenário / Dado / Quando / Então

评估结果(EvalResult,保存为 results/eval_<prompt_type>.csv

复用输入列,并添加以下列:

列名 类型 描述
rating int(1–5) 评判者评分;失败时为null
reasoning string 详细理由(评判者返回的JSON格式)
thinking string 模型的推理链(reasoning_content),可用时提供

BDD场景格式要求

生成器产出单个“幸福路径”场景,使用Gherkin语法(巴西葡萄牙语):

Cenário: [场景名称] Dado [前置条件] Quando [操作] Então [预期结果]

可用的提示策略包括:zs(零样本)、fs(少样本)和cot(思维链)。


访问与使用

  • 访问权限:该数据集为私有数据,需要HuggingFace token并对metabrasil组织具有读取权限。
  • 加载方式:使用 datasets.load_dataset("metabrasil/bdd_scenarios", ...),并根据阶段选择相应配置和split。
  • 许可证:内部使用,不面向外部分发,访问受组织级token控制。

数据来源与上下文

User Stories为META Brasil内部BDD基准测试所整理。消费该数据集的pipeline(生成+评估+API)的代码存储在仓库 ceia-meta-bench-data 下的 services/bdd-eval-gen/ 目录中(GitHub仓库地址)。

搜集汇总
数据集介绍
bdd_scenarios 数据集图片
构建方式
该数据集由META Brasil构建,专用于评估基于LLM的BDD(行为驱动开发)场景生成与评估流水线。数据集包含两个配置:'paper'配置用于生成任务,提供用户故事和需求描述作为输入;'eval'配置用于评估任务,包含用户故事、描述及待评估的BDD场景。构建过程遵循Gherkin语法规范,生成单一的'Given/When/Then'场景。数据集的访问通过HuggingFace令牌控制,确保私有性。
特点
该数据集的核心特点在于其双配置设计,精准匹配生成与评估两阶段流水线的需求。'paper'配置聚焦于生成输入,而'eval'配置则整合了生成结果与评估所需信息。此外,数据集支持多种提示策略(如零样本、少样本和思维链),并内置了评分机制(1-5分)及详细的评判理由,为自动化质量评估提供了结构化支撑。
使用方法
使用该数据集时,用户需通过HuggingFace的load_dataset函数加载指定配置,并配备有效的访问令牌。生成任务加载'paper'配置,评估任务加载默认'eval'配置。数据集可直接用于bd-eval-gen服务,也可通过API发送自定义输入。此外,服务支持回退至本地CSV文件,便于离线开发与测试。
背景与挑战
背景概述
bdd_scenarios数据集由巴西META团队于近期构建,旨在评估基于大语言模型(LLM)的BDD(行为驱动开发)场景生成与评价流程。该数据集源于内部基准测试,核心研究问题在于自动化地将用户故事转化为结构化的Given/When/Then场景,并利用LLM裁判对生成质量进行1至5分的量化评价。数据集包含生成与评估两种配置,分别服务于场景自动生成与质量校验两个关键环节,为软件需求工程中的行为建模提供了可复现的评测基准,推动了LLM在需求工程领域的应用研究,对提升BDD实践效率具有潜在影响力。
当前挑战
该数据集面临的挑战包括领域问题与构建过程两方面。领域问题中,BDD场景生成需精准捕捉用户故事的业务意图,并产出符合Gherkin语法及行为规范的场景,而现有LLM在语义保真度与逻辑一致性上仍有不足;评估环节的挑战在于设计可靠的多维度评分标准,以客观衡量生成场景的准确性、完整性及可执行性,避免主观偏差。构建过程中,因数据集私有性质,需通过HuggingFace令牌控制访问权限,确保数据安全;同时,配置设计需要兼顾生成与评估两阶段的不同列结构,并解决加载器对默认配置的依赖问题,以保证流水线的无缝集成与可复现性。
常用场景
经典使用场景
bdd_scenarios数据集作为META Brasil内部基准测试的核心资源,专为行为驱动开发(BDD)场景的自动化生成与评估而设计。该数据集广泛应用于基于大型语言模型(LLM)的pipeline中,涵盖两个核心环节:一是从用户故事(User Stories)自动生成Gherkin格式的Given/When/Then场景;二是利用LLM作为评判者,对生成场景的质量进行1至5分的量化评分,并提供详细的理由与推理链。研究者借助该数据集,可系统性评估不同提示策略(如零样本、少样本、思维链)对BDD场景生成质量的影响,从而优化自动化需求分析流程。
解决学术问题
该数据集有效解决了软件工程领域中从自然语言需求到可执行测试场景的自动转换难题。传统上,BDD场景的编写依赖人工专家,耗时且易出错。通过提供标准化的用户故事与对应的BDD场景及质量评估标签,该数据集支持研究者训练和评估基于LLM的生成模型,推动需求工程与自然语言处理交叉领域的学术进展。其内置的评估机制(评分+理由)为场景质量度量提供了可复现的基准,促进了自动化测试生成技术从理论走向实践。
衍生相关工作
该数据集的核心贡献在于其评估框架,该框架已被复用于多项相关研究。例如,后续工作可能扩展其评估维度,从单一评分到多标准评估(如可执行性、业务规则覆盖),或比较不同LLM(如GPT-4、Llama)在生成与评估任务上的表现。此外,数据集中的提示策略(zero-shot、few-shot、chain-of-thought)对比分析,衍生出关于提示工程在需求工程中应用的研究。更广泛地,该基准推动了自动化BDD场景生成工具的研发,并启发其他团队构建类似的领域特定数据集,为AI驱动的软件开发提供更多实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务