遇见数据集

swetry1

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

该数据集包含与软件工程代码修复或测试生成任务相关的样本,每个样本代表一个来自GitHub仓库的实例,关联到拉取请求和问题跟踪。数据集定义了丰富的特征字段,包括:标识信息(如仓库名、拉取请求编号、实例ID、问题编号列表)、代码变更信息(如基础提交哈希、代码补丁、测试补丁)、任务描述(如问题陈述、提示文本、所有提示文本)、过程信息(如提交URL列表、创建时间、提交URL)、执行命令(如重建命令列表、测试命令列表、打印命令列表)、测试结果(如从失败到通过的测试列表、从通过到通过的测试列表)以及环境配置(如日志解析器、Docker镜像)。每个样本还包含一个难度评估结构体,记录涉及的文件数、代码块数和代码行数。数据集目前仅包含一个名为python的分割,共有9个样本,总数据集大小约为535.58 KB,下载大小约为517.57 KB,适用于代码自动修复、测试用例生成、程序分析或软件维护等相关的研究与开发任务。

This dataset contains samples related to software engineering code repair and test generation tasks. Each sample represents an instance sourced from a GitHub repository, linked to pull requests and issue trackers. The dataset defines a rich set of feature fields, including identification information (such as repository name, pull request number, instance ID, list of issue numbers), code change information (such as base commit hash, code patch, test patch), task description (such as problem statement, prompt text, all prompt texts), process information (such as list of commit URLs, creation time, commit URL), execution commands (such as list of rebuild commands, list of test commands, list of print commands), test results (such as list of tests that changed from failed to passed, list of tests that remained passed), and environment configuration (such as log parser, Docker image). Each sample also includes a difficulty assessment structure that records the number of involved files, number of code blocks, and lines of code. Currently, the dataset only contains one split named "python", with a total of 9 samples. The total dataset size is approximately 535.58 KB, and the download size is about 517.57 KB. This dataset is applicable to research and development tasks related to automatic code repair, test case generation, program analysis, or software maintenance.

创建时间:
2026-06-26
原始信息汇总

数据集概述:lieeli/swetry1

  • 数据集地址:https://huggingface.co/datasets/lieeli/swetry1

数据特征

该数据集包含以下字段:

  • repo:仓库名称(字符串)
  • pull_number:拉取请求编号(字符串)
  • instance_id:实例ID(字符串)
  • issue_numbers:相关议题编号列表(字符串列表)
  • base_commit:基础提交哈希(字符串)
  • patch:补丁内容(字符串)
  • test_patch:测试补丁内容(字符串)
  • problem_statement:问题描述(字符串)
  • hints_text:提示文本(字符串)
  • all_hints_text:所有提示文本(字符串)
  • commit_urls:提交URL列表(字符串列表)
  • created_at:创建时间(字符串)
  • commit_url:提交URL(字符串)
  • rebuild_cmds:重建命令列表(字符串列表)
  • test_cmds:测试命令列表(字符串列表)
  • print_cmds:打印命令列表(字符串列表)
  • log_parser:日志解析器(字符串)
  • FAIL_TO_PASS:失败到通过的测试列表(字符串列表)
  • PASS_TO_PASS:通过到通过的测试列表(字符串列表)
  • docker_image:Docker镜像名称(字符串)
  • difficulty:难度结构,包含:
    • files:文件数量(整数)
    • hunks:补丁块数量(整数)
    • lines:代码行数(整数)

数据集划分

  • 划分名称python
  • 样本数量:9条
  • 数据大小:535,580字节(下载大小:517,571字节)

配置文件

  • 配置名称default
  • 数据文件split: python,路径为 data/python-*
搜集汇总
数据集介绍
swetry1 数据集图片
构建方式
Swetry1数据集旨在聚焦Python仓库中真实且具有挑战性的软件工程问题,其构建流程基于对开源项目Pull Request的精细筛选。每个样本包含问题所涉及的仓库名称、Pull请求编号以及关联的Issue标识,确保数据可追溯至具体的代码变更场景。数据收集过程中,系统化地记录了基础提交哈希、修复补丁与测试补丁,并辅以问题陈述与多级提示文本,为问题理解提供了丰富的上下文。此外,数据集囊括了重建与测试命令、日志解析规则以及Docker镜像信息,保障了问题复现与评估环境的一致性。通过标注从失败到通过及通过到通过的测试用例变化,Swetry1为评估自动修复能力构建了严谨的基准。
使用方法
使用Swetry1数据集时,研究者可加载默认配置下的Python子集,其中包含9个标注清晰的问题样本。每条数据中的patch与test_patch字段可直接用于训练或评估程序自动修复模型,而problem_statement与hints_text则为开发基于自然语言理解的修复策略提供了输入。通过解析rebuild_cmds、test_cmds等命令字段,用户能够在给定的Docker容器中复现问题并验证补丁效果。难度指标(files、hunks、lines)可用于定制不同能力层级的评测任务。数据集的各个字段以标准字符串与列表形式组织,便于开发者利用常见的机器学习框架进行加载与处理,从而在Python软件可靠性研究领域推动更深入的探索。
背景与挑战
背景概述
Swetry1数据集诞生于自动程序修复与代码智能领域的研究前沿,由一批专注于软件工程与机器学习交叉学科的研究人员构建。该数据集旨在系统性地收集GitHub上的真实Pull Request及其对应的补丁信息、测试用例和问题描述,为评估模型在代码修复与生成任务中的表现提供标准化benchmark。其核心研究问题聚焦于如何利用历史修复数据训练深度神经网络,使其能够理解问题陈述并生成准确的代码补丁。尽管规模尚小,但Swetry1为领域内探索少样本学习与代码修复的迁移能力奠定了重要基础。
当前挑战
当前Swetry1数据集面临多重挑战。首先,在领域问题层面,自动程序修复的核心难题在于补丁的稀疏性与正确性验证:模型需从海量潜在修改中定位极少数正确修复,且修复后代码必须通过完整测试套件。其次,在构建过程中,数据集仅包含9个样本,且全部来自Python仓库,样本多样性严重不足,难以支撑复杂模型的泛化训练。此外,数据采集依赖GitHub的Pull Request元数据与补丁格式解析,易受仓库维护策略差异与版本迭代影响,导致标注噪声与领域偏见。如何扩展规模并平衡语言与任务分布,是当前亟待攻克的构建瓶颈。
常用场景
经典使用场景
Swetry1数据集是专为软件工程与自然语言处理交叉领域设计的高质量资源,其核心使用场景聚焦于自动化代码缺陷修复与维护任务。通过提供包含代码仓库信息、问题陈述、补丁细节及测试命令的结构化数据,该数据集支持研究者构建和评估基于深度学习的程序修复模型。经典用法包括利用问题描述与补丁差异训练模型以生成修复方案,或通过测试用例执行结果验证修复正确性,从而推动智能化软件开发工具的进步。
解决学术问题
该数据集主要解决了软件维护领域中自动化缺陷定位与修复的学术难题。传统手动调试耗时且易出错,而Swetry1提供了标准化、可复现的基准,使研究者能够系统性地评估模型在真实世界代码库上的修复能力。其影响在于促进了从经验驱动到数据驱动的研究范式转变,推动了程序合成、代码理解及测试驱动生成等方向的发展,为构建更可靠的软件系统奠定了方法论基础。
实际应用
在实际场景中,Swetry1可用于企业级持续集成流水线中的自动缺陷修复,减少人工审查负担。开发团队可利用整合模型自动生成补丁建议,加速版本迭代周期。此外,其结构化的测试命令和Docker镜像配置便于集成到CI/CD工具链中,实现从问题报告到补丁验证的全流程自动化,显著提升软件交付效率与质量。
数据集最近研究
最新研究方向
在当前软件工程与人工智能交叉的前沿领域中,swetry1数据集作为针对开源仓库(如SWE-bench类任务)的微调与评估基准,正成为推动代码智能体自动修复缺陷的关键资源。该数据集融合了丰富的代码仓库元数据、补丁信息及多维度测试指令,为研究者提供了探究软件缺陷修复的完整上下文。近期研究聚焦于利用大语言模型(LLM)与强化学习技术,基于此类数据集构造可复现的故障修复流程,以提升自动化编程助手的鲁棒性与泛化能力。swetry1的出现助力了从静态程序分析向动态交互式修复范式的转变,尤其在持续集成(CI)与DevOps场景中具有显著应用价值,其结构化难度指标更开启了对修复任务复杂度的精确量化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务