TDD-Bench-Verified
收藏资源简介:
TDD-Bench-Verified是一个用于生成测试驱动开发(TDD)测试用例的新基准数据集。每个实例包含一个自然语言的问题描述和问题解决前的代码库版本。预测结果应包括在旧代码库上失败的测试用例,并在新代码库上通过。数据集包含449个实例,并提供了一个基于Docker的评估工具来评估预测结果。
TDD-Bench-Verified is a novel benchmark dataset designed for generating Test-Driven Development (TDD) test cases. Each instance consists of a natural language problem description and the initial version of the codebase prior to problem resolution. The required prediction should include test cases that fail against the initial codebase but pass when executed on the updated codebase. The dataset comprises 449 instances, and provides a Docker-based evaluation tool for assessing prediction outcomes.
TDD-Bench-Verified 数据集概述
数据集简介
- 名称: TDD-Bench-Verified
- 类型: 用于测试驱动开发(TDD)的测试用例生成基准
- 描述:
- 该数据集包含449个实例,每个实例由自然语言的issue描述和代码库的原始版本组成。
- 目标是生成一组测试用例,这些测试用例在代码库的原始版本上失败,但在代码库的新版本上通过。
- 数据集提供了一个基于Docker的评估工具,用于评估生成的测试用例的失败到通过标准和代码覆盖率。
数据集结构
- 实例: 每个实例包含以下信息:
d_issue: 自然语言的issue描述c_old: 代码库的原始版本c_new: 代码库的新版本(用于验证测试用例)
- 预测: 每个实例的预测结果包含一组测试用例,这些测试用例应在
c_old上失败,在c_new上通过。
数据集使用
-
安装:
-
使用Docker进行可重复的评估。
-
通过以下命令从源代码构建数据集: bash git clone https://github.ibm.com/tfahmed/TDD-Bench-Verified.git cd TDD-Bench-Verified pip install -e .
-
生成包含完整数据集的
TDD_Bench.json文件: bash python dataset_preparation.py
-
-
测试安装:
- 运行以下命令测试安装: bash python -m tddbench.harness.run_evaluation --predictions_path gold --max_workers 1 --instance_ids astropy__astropy-14995 --run_id validate-gold
-
评估模型预测:
- 使用评估工具评估模型生成的测试补丁:
bash
python -m tddbench.harness.run_evaluation
--dataset_name TDD_Bench.json
--predictions_path <path_to_predictions> --max_workers <num_workers> --run_id <run_id>
- 使用评估工具评估模型生成的测试补丁:
bash
python -m tddbench.harness.run_evaluation
--dataset_name TDD_Bench.json
依赖项
- Python版本: 3.11或更高版本
- 依赖库:
- beautifulsoup4
- datasets
- docker
- ghapi
- python-dotenv
- requests
- unidiff
- tqdm
- pytest
- cldk




