遇见数据集

ierd-codeforces-subtle-bugs

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是IERD Codeforces Subtle Bugs数据集,包含682个针对682个Codeforces问题生成的细微有缺陷C++解决方案。每个解决方案通过了冻结源语料库中的大部分测试,但会失败1到5个存储的人类或Hugging Face测试。数据集还包含冻结清单、来源文件以及最终测试生成研究的汇总报告。数据来源于sr3nn/codeforces-1000-dataset,该数据集源自Google DeepMind CodeContests。数据集提供多个配置(mutations、upstream20、exploratory-v1、final-v2、count-ablation-v3、output-only-v4、paper-baseline-v6等),包括主表(mutations)和各类生成测试及批次状态文件。主表包含26列,记录了问题ID、变异体ID、有缺陷源码、参考解决方案、测试失败计数、变异来源等详细信息。生成测试配置包含不同协议下的测试输入和批次状态,总计超过21万条记录。该数据集适用于测试生成、突变测试和细微错误检测的研究。注意:有缺陷程序是生成的,应在受限沙箱中执行。

This dataset is the IERD Codeforces Subtle Bugs dataset, containing 682 subtly defective C++ solutions generated for 682 Codeforces problems. Each solution passes the majority of tests in the frozen source corpus but fails 1 to 5 stored human or Hugging Face tests. The dataset also includes a frozen manifest, source files, and a summary report for final test generation research. The data originates from sr3nn/codeforces-1000-dataset, which is derived from Google DeepMind CodeContests. The dataset provides multiple configurations (mutations, upstream20, exploratory-v1, final-v2, count-ablation-v3, output-only-v4, paper-baseline-v6, etc.), including a main table (mutations) and various generated test and batch status files. The main table contains 26 columns recording details such as problem ID, variant ID, defective source code, reference solution, test failure count, mutation source, etc. The generated test configurations include test inputs and batch status under different protocols, totaling over 210,000 records. This dataset is suitable for research in test generation, mutation testing, and subtle bug detection. Note: The defective programs are generated and should be executed in a restricted sandbox.

创建时间:
2026-08-16
原始信息汇总

IERD Codeforces Subtle Bugs 数据集概述

基本信息

  • 许可证: CC BY 4.0
  • 语言: 英语
  • 规模: 100K < n < 1M
  • 任务类别: 文本生成
  • 标签: 代码、竞争性编程、软件测试、变异测试、测试生成

数据集内容

该数据集包含 682个生成的有缺陷C++解决方案,对应682个Codeforces问题。每个解决方案通过冻结源语料库中的大部分测试,但会在1到5个存储的人类或Hugging Face测试中失败。

数据来源

  • 基于 sr3nn/codeforces-1000-dataset(commit e0d77676690682abc3905fb6c50cc613fa3439a0
  • 该数据集源自 Google DeepMind CodeContests
  • 冻结名册包含1,000个问题,SHA-256: 3ac8b48cf7be78a7fc3b761f43e9146b1f6e0d88cada50b5ddf27ab34c50af76
  • 接受的变异清单包含682行,SHA-256: 1b833a1596f8c62925ad12f38c0645957909d74a69cdc0374caea1bf73e72934

文件结构

  • data/mutations.parquet — 主表(mutations/train 分割)
  • data/mutations.jsonl.gz — 确定性的逐行副本
  • data/accepted_buggy_solutions.jsonl — 精确冻结清单
  • solutions/ — 每个接受变异的C++文件
  • generated-tests/ — Parquet查看表、确定性JSONL gzip副本、组合索引、模式、计数、来源哈希和校验和
  • provenance/ — 来源导出、冻结摘要和固定的上游元数据
  • reports/ — 最终v2、独立计数v3、仅输出v4和Study E v6报告
  • CHECKSUMS.sha256 — 除自身外每个上传文件的SHA-256哈希

主表列

列名 含义
schema_version 冻结清单模式版本
problem_id Codeforces问题标识符
roster_position 冻结的1,000问题名册中的零基位置
mutation_id 稳定的已接受变异标识符
buggy_source 完整的生成C++源代码
source_sha256 buggy_source 的SHA-256
solution_path solutions/ 下匹配的文件
mutation_provider 产生变异的路径
mutation_model 记录的具体模型归属
mutation_created_at 来源生成数据库的时间戳
human_hf_failure_count 变异失败的存储源测试数量(1-5)
fail_compile, fail_runtime, fail_timeout, fail_wrong_answer 按结果分类的失败计数
reference_a_id, reference_b_id 两个冻结参考解决方案的ID
reference_a_sha256, reference_b_sha256 两个参考的冻结来源哈希
reference_a_source, reference_b_source 两个独立存储的正确参考的完整来源文本
source_dataset, source_revision, roster_sha256 固定的源数据集身份
stored_tests_generated, stored_tests_private, stored_tests_public, stored_tests_total 变异接受时可用的测试来源计数

变异选择

  • 模型生成对已验证参考解决方案的小改动
  • 本地管道针对问题的所有可用存储测试编译并运行每个候选
  • 只有当变异导致1到5个测试失败时才接受
  • 失败类型可为错误答案、运行时错误或超时;编译失败也被记录
  • 清单每个包含问题冻结一个已接受的变异

测试生成研究

  • 每个问题和提供者固定预算50个请求输入
  • plain-50-raw-v2: 仅给模型问题陈述
  • saga-mutap-50-raw-v2: 给每个提供者自己的陈述分析、已验证参考和冻结突变体;请求35个初始输入,本地评估,再请求15个使用状态和检测反馈的输入
  • 生成输入仅在两个冻结参考解决方案成功完成并产生相同token标准化输出时有效
  • 有效输入在突变体返回不同输出、崩溃或超时时检测到错误

生成测试查看器配置

配置/分割 行数 内容
upstream20/tests 27,250 早期上游管道生成的输入
exploratory-v1/tests 45,800 探索性v1生成的输入
exploratory-v1-status/batch_status 2,724 每个未评估的v1批次
final-v2/tests 136,000 每个2,720个评估v2批次中恰好50个原始槽位
final-v2-status/batch_status 8 终端失败的v2批次
count-ablation-v3-tests/tests 120,798 独立计数v3协议的存储原始槽位
count-ablation-v3-batches/batches 10,230 每个冻结的v3设计批次
output-only-v4-tests/tests 62,407 仅输出v4协议的存储原始槽位
output-only-v4-batches/batches 4,774 每个冻结的v4设计批次
paper-baseline-v6-tests/tests 66,850 每个评估Study E v6批次中恰好50个存储原始槽位
paper-baseline-v6-batches/batches 1,364 每个注册的Study E v6批次
combined-index/train 211,782 所有导出的测试和批次状态记录的薄索引

使用限制与预期用途

  • 支持测试生成、变异测试和微妙错误检测的研究
  • 结果仅适用于此选定的Codeforces语料库、冻结突变体和记录的模型版本
  • 有缺陷的程序是生成产物,不得在受限沙箱之外执行,某些源文件可能包含不安全或不可移植代码
  • 接受的测试计数衡量存储的源测试,而非错误严重程度
  • 生成的测试配置不包含提供者HTTP信封、重试日志、时间/资源遥测或源SQLite数据库

引用与归属

  • 固定源数据集声明非代码材料为CC BY 4.0
  • Codeforces陈述和参赛者提交可能有单独条款
  • 使用时应引用固定源数据集、Google DeepMind CodeContests以及研究中使用的论文方法
搜集汇总
数据集介绍
ierd-codeforces-subtle-bugs 数据集图片
构建方式
该数据集基于Codeforces竞赛编程问题,从已验证的参考解决方案中,通过模型生成微小改动并执行本地编译与测试流程,筛选出恰好导致1至5个存储测试失败(涵盖错误答案、运行时错误或超时)的变异体,最终为682道问题各保留一个被接受的缺陷程序,并冻结其清单与哈希值。
特点
数据集涵盖682个精心构造的微妙缺陷C++程序,每个缺陷程序均通过多数测试但隐藏错误。除主表外,还提供了多轮测试生成实验的完整记录,包括输入、批次状态及结果报告,并附有来源数据固定版本、校验和及详尽元数据,确保可追溯性与可审计性。
使用方法
此数据集适用于测试生成、变异测试及微妙缺陷检测研究。用户可利用变异程序与参考解决方案评估测试生成方法,也可通过Hugging Face配置加载生成的测试输入与批次状态,结合报告进行统计分析。数据需在受控沙箱中安全使用,并遵守CC BY 4.0许可及上游条款。
背景与挑战
背景概述
该数据集名为IERD Codeforces subtle bugs,由研究团队在2025年创建,旨在解决竞争性编程中细微缺陷检测与测试生成的问题。其核心研究问题在于探索如何通过模型生成的微妙变异(即细微缺陷)来评估和改进测试生成方法的效果,特别是针对Codeforces问题集。数据集基于Google DeepMind的CodeContests和sr3nn/codeforces-1000-dataset构建,包含682个可复现的缺陷C++程序,每个程序对应一个Codeforces问题,且这些程序在绝大多数原始测试案例中表现正常,但会在特定输入下失败。该数据集为突变测试、测试生成和缺陷检测领域提供了真实且细粒度的基准,其影响力体现在为比较不同测试生成策略提供了统一平台,促进了SAGA和MuTAP等自适应方法的实证研究。
当前挑战
当前挑战聚焦于多维度:领域层面,竞争性编程中的细微缺陷常因逻辑边界或条件疏漏而难以感知,且变异测试需平衡变异强度与真实性,此数据集通过控制缺陷规模(1-5个测试失败)精确模拟了此类难点;构建过程中,生成有效变异需兼顾编译可行性、对参考解的保真度及测试失败的范围,团队通过双重参考源码验证与哈希固定确保了数据完整性,但测试生成中子集采样偏差、模型输出不稳定性及评估协议的可扩展性仍是显著挑战,例如v6协议中27批次未完成及v4协议中模型排除问题,反映了资源限制与实验设计的严格性冲突。
常用场景
经典使用场景
该数据集聚焦于竞赛编程中微妙缺陷的检测与测试生成,为算法正确性验证提供了严苛的基准。其核心使用场景在于评估生成式模型对代码中隐蔽逻辑错误的识别能力,通过变异测试框架,研究者可利用682个经过严格筛选的缺陷C++程序,系统性地测试模型在有限输入预算下生成有效测试用例的效能。这一场景不仅度量了模型对程序语义的深层理解,还考察了其在处理边界条件、异常路径时的鲁棒性,成为软件工程与人工智能交叉领域的标准化评测平台。
实际应用
在实际应用中,该数据集可作为软件持续集成流水线中变异测试模块的校准工具,辅助工程团队评估自动化测试套件的弱点。其生成的缺陷程序可注入真实项目以验证静态分析与动态测试工具的有效性,尤其在资源受限的工业场景中,帮助权衡测试预算与缺陷检出率。此外,数据集提供的高质量突变体可作为训练语料,用于增强代码生成模型对潜在缺陷的感知能力,进而提高生成代码的可靠性,对开发者辅助工具、代码审查系统具有直接改进价值。
衍生相关工作
该数据集衍生了一系列围绕测试生成优化与变异分析的前沿工作。其协议设计借鉴SAGA与MuTAP方法,催生了结合状态反馈与迭代细化的自适应测试生成策略,显著提升了输入稀缺条件下的缺陷暴露效率。后续研究进一步探索输出约束、计数消融等变体,系统解构了模型先验、推理深度与测试有效性的关联。该数据集已成为评估大语言模型在代码理解与生成任务上潜能的基准,推动了包括提示工程、少样本学习及测试先知构建在内的多个子方向的科学进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务