遇见数据集

beranki/gpt-5-mini-rebench-v2-go

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含250个训练示例,每个示例具有多个特征,如实例ID、补丁、失败到通过的列表、通过到通过的列表、图像名称、仓库、问题陈述、成功率、轨迹、轨迹完整字节数、轨迹是否被限制、轨迹SHA256哈希值、完成运行次数、模型和使用的配置。数据集可能用于分析代码或任务执行轨迹,特别是评估模型在从失败状态转换到通过状态的表现,适用于机器学习或自然语言处理研究。

This dataset consists of 250 training examples, each with multiple features including instance ID, patch, FAIL_TO_PASS list, PASS_TO_PASS list, image name, repository, problem statement, success rate, trajectories, trajectories full bytes, trajectories capped flag, trajectories SHA256 hash, number of runs completed, model, and configurations used. It likely focuses on code or task execution trajectories, particularly for evaluating model performance in transitioning from failure to pass states, suitable for machine learning or natural language processing research.

提供机构:
beranki
搜集汇总
数据集介绍
beranki/gpt-5-mini-rebench-v2-go 数据集图片
构建方式
该数据集名为gpt-5-mini-rebench-v2-go,是面向软件工程领域缺陷修复任务构建的高质量基准数据集。其构建基于大规模自动化代码修复实验,通过引入先进的gpt-5-mini模型对开源仓库中的缺陷进行修复,并系统记录修复过程中的关键信息。数据集的每条样本包含实例标识符、补丁代码、测试用例状态变化(FAIL_TO_PASS与PASS_TO_PASS列表)、仓库镜像名称、所属仓库、问题描述文本、修复成功率、模型运行轨迹及其完整性校验信息。经过多轮迭代与验证,最终筛选出250条高质量修复案例,形成训练集,并以parquet格式存储于HuggingFace平台,便于研究者直接加载。
特点
该数据集的显著特点在于其多维度的结构化信息与严格的质控机制。每条样本不仅涵盖缺陷修复所需的上下文,如问题陈述与补丁,还记录了模型在多次运行中的成功概率,为评估修复策略的可靠性提供了量化依据。同时,轨迹字段保存了模型完整的推理过程,配合SHA256校验与截断标记,确保了数据的可追溯性与完整性。此外,数据集中包含模型配置参数与运行次数信息,支持对修复行为的可重复性分析。这种精细化的设计使得该数据集不仅适用于传统缺陷定位研究,更能服务于可解释性分析、修复策略对比等前沿探索。
使用方法
使用该数据集时,研究者可通过HuggingFace Datasets库轻松加载。首先安装datasets库,随后调用load_dataset函数指定数据集路径与拆分名称,即可获取包含250条样本的训练集。每个样本以字典形式返回,字段覆盖实例标识符、补丁代码、测试状态变化、修复成功率及模型轨迹等。针对轨迹数据,可结合json库解析其存储的推理细节。由于数据已统一预处理,用户可直接基于problem_statement进行缺陷分类,或利用patch与测试状态指标构建修复模型,亦可通过trajectories分析模型决策过程。推荐在实验中按需复现模型配置,以验证修复效果的稳定性。
背景与挑战
背景概述
该数据集由研究人员构建,旨在评估和改进代码修复模型的性能。数据集创建于近年,包含了来自多个开源仓库的250个代码补丁实例,每个实例都提供了详细的失败到通过(FAIL_TO_PASS)和通过到通过(PASS_TO_PASS)测试用例信息、问题陈述以及模型生成的轨迹。其核心研究问题在于如何通过自动化方法高效、准确地修复代码中的错误,尤其关注模型在多次运行中的稳定性和成功率。该数据集为代码修复领域提供了标准化的评估基准,推动了基于学习的方法在软件维护中的发展。
当前挑战
数据集所解决的领域问题在于代码修复的自动化挑战,即如何让模型从大量代码和测试用例中学习,生成能够通过所有测试的正确补丁。构建过程中面临的挑战包括:确保数据集的多样性和代表性,覆盖不同编程语言、仓库和错误类型;准确记录模型轨迹以支持后续分析;以及处理轨迹可能过长或需要截断的问题。此外,还需平衡补丁的成功率与运行次数,避免模型过度拟合特定模式,同时保证评估的公平性和可重复性。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域,gpt-5-mini-rebench-v2-go数据集被广泛用于评估和提升代码修复模型的性能。该数据集收录了250个来自真实世界Go语言仓库的实例,每个实例包含问题描述、生成的补丁、失败到通过的测试用例转化情况以及完整的修复轨迹。其经典用途在于作为基准测试集,衡量大语言模型在自动程序修复任务中的表现,通过成功率指标(success_rate)和测试用例状态变化,直观对比不同模型或配置的修复效果。
实际应用
在实际软件工程中,该数据集可应用于开发高效的自动化代码审查与缺陷修复工具。例如,集成到持续集成/持续部署流程中,当单元测试失败时,借助基于此数据集微调的模型自动生成补丁并验证其有效性。Go语言社区尤其受惠,因为数据集聚焦于该语言生态,能够辅助开源项目维护者快速定位并修复常见编程错误,显著降低人工调试时间。同时,数据集支持模型配置(configs_used)追踪,便于工程团队根据实际场景调优修复策略。
衍生相关工作
基于该数据集衍生出一系列重要研究工作,例如针对代码修复轨迹分析的模型架构改进,通过解析trajectories字段中的多步修复路径,研究者提出了记忆增强的序列到序列模型;另有工作利用FAIL_TO_PASS和PASS_TO_PASS测试转化数据,设计了基于测试信号强化学习的补丁排序算法。此外,数据集的image_name和repo信息催生了跨仓库缺陷迁移学习研究,探索如何将修复知识从熟悉的代码库泛化到未知项目,推动了大语言模型在软件维护领域的深度应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务