遇见数据集

DLI-Lab/COFFEE-Dataset-both-correct-and-incorrect-edit-feedback

收藏
Hugging Face2024-06-03 更新2024-06-12 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: data/train-* - split: eval path: data/eval-* dataset_info: features: - name: problem_id dtype: string - name: input_format dtype: string - name: output_format dtype: string - name: description dtype: string - name: wrong_code dtype: string - name: correct_code dtype: string - name: gold_feedback dtype: string - name: test_cases sequence: sequence: string splits: - name: train num_bytes: 3159444873 num_examples: 9958 - name: eval num_bytes: 386625721 num_examples: 1107 download_size: 904386160 dataset_size: 3546070594 --- # Dataset Card for "COFFEE-Dataset-both-correct-and-incorrect-edit-feedback" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

该数据集名为COFFEE-Dataset-both-correct-and-incorrect-edit-feedback,包含训练集和评估集,分别有9958和1107个样本。数据集的特征包括问题ID、输入格式、输出格式、描述、错误代码、正确代码、黄金反馈和测试用例。

提供机构:
DLI-Lab
原始信息汇总

数据集概述

配置信息

  • 默认配置 (default):
    • 训练数据路径: data/train-*
    • 评估数据路径: data/eval-*

数据集特征

  • 特征名称: problem_id, input_format, output_format, description, wrong_code, correct_code, gold_feedback, test_cases
  • 数据类型: 所有特征均为string类型,其中test_cases为序列类型,其子类型也为string

数据集分割

  • 训练集 (train):
    • 样本数量: 9958
    • 数据大小: 3159444873 字节
  • 评估集 (eval):
    • 样本数量: 1107
    • 数据大小: 386625721 字节

数据集大小

  • 下载大小: 904386160 字节
  • 数据集总大小: 3546070594 字节
搜集汇总
数据集介绍
构建方式
在编程教育领域,高质量的反馈数据集对于提升自动化代码纠错与教学系统的性能至关重要。DLI-Lab/COFFEE-Dataset-both-correct-and-incorrect-edit-feedback 数据集由 DLI-Lab 精心构建,旨在捕捉学生代码编辑过程中的正确与错误反馈模式。该数据集包含约 9958 条训练样本和 1107 条评估样本,每条样本均包含问题标识符、输入输出格式描述、错误代码与正确代码的对照,以及对应的黄金标准反馈。此外,数据集还提供了测试用例序列,以支持多维度的模型评估。数据以分片形式存储于 train-* 和 eval-* 文件中,便于高效加载与处理。
使用方法
使用者可通过 HuggingFace Datasets 库便捷加载该数据集,默认配置为 'default',系统会自动定位 data/train-* 和 data/eval-* 路径下的分片文件。数据集支持按 'problem_id' 进行问题级检索,也可将 'wrong_code'、'correct_code' 与 'gold_feedback' 组合用于序列到序列模型的训练。测试用例字段可作为评估模型生成代码正确性的辅助工具。建议将训练集用于模型微调,评估集用于性能监控,以构建能够区分正确与错误编辑反馈的鲁棒系统。
背景与挑战
背景概述
在程序语言智能与教育技术交叉领域,为学习者提供精准的代码编辑反馈是提升编程教学效率的关键挑战。DLI-Lab/COFFEE-Dataset-both-correct-and-incorrect-edit-feedback数据集由DLI实验室团队创建,聚焦于代码纠错与反馈生成这一核心研究问题。该数据集包含近万条训练样本与千余条评估样本,每条数据涵盖问题描述、错误代码、正确代码及黄金标准反馈,并附有测试用例。其发布旨在推动基于深度学习的自动化代码纠错与教学反馈系统的发展,为自然语言处理与程序合成研究提供标准化评测基准,对智能编程辅导工具的开发具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于实现从错误代码到正确代码的精准转换,并生成自然语言形式的编辑反馈,这要求模型同时理解代码语义、逻辑错误类型及教学性表达。构建过程中面临的主要挑战包括:1)收集多样化编程问题及其对应的真实错误代码与正确解法,确保覆盖常见错误模式;2)设计高质量、一致性强的黄金标准反馈文本,需兼顾技术准确性与教学可读性;3)处理代码与自然语言之间的异构对齐问题,使反馈能精确指向具体错误位置与修改建议。这些挑战对数据标注标准化与模型泛化能力提出了极高要求。
常用场景
经典使用场景
在程序语言教学与自动化代码修复领域,COFFEE数据集以其独特的双轨标注——同时涵盖正确与错误的编辑反馈——而成为训练智能教学系统的基石。该数据集包含近万条训练样本与千余条评估样本,每项样本均关联问题描述、错误代码、正确代码以及黄金标准反馈,并辅以丰富的测试用例,为构建能够精准诊断编程错误并生成自然语言指导的模型提供了理想的数据支撑。其经典使用场景聚焦于开发基于深度学习的代码修复反馈生成器,通过对比正确与错误编辑路径,模型得以学习如何区分有效修正与常见误区,从而在编程教育中扮演虚拟导师的角色。
解决学术问题
COFFEE数据集精准回应了计算机教育研究中的核心痛点:如何自动化地为学习者提供具体、可操作的代码修正建议。传统研究多依赖静态代码分析或规则匹配,难以覆盖语义多样的错误类型,而该数据集通过结构化标注错误代码与正确代码的对应关系,使得模型能够从数据中习得从错误到正确的编辑模式。这不仅解决了缺乏大规模、高质量代码反馈平行语料库的困境,还推动了从简单错误检测向生成式反馈的范式跃迁,为探究代码理解、差异语义编码以及反馈语言生成等学术课题奠定了实验基础,其意义在于弥合了人工教学与自动化辅助之间的鸿沟。
实际应用
在实际应用中,COFFEE数据集赋能了一系列智能编程辅导工具与在线判题系统的升级。基于该数据集训练的模型可被集成到交互式编程环境中,当学习者提交错误代码时,系统不仅能指出语法或逻辑问题,还能以自然语言形式生成逐步修正建议,甚至对比展示正确与错误的编辑差异。此外,该数据集还可用于构建自动化代码评审助手,在团队协作开发中辅助审查代码质量,或为大规模开放在线课程(MOOC)提供个性化作业反馈,显著降低教师批改负担并提升学习效率。其应用场景横跨教育科技与软件工程,展现了数据驱动反馈生成技术的实用价值。
数据集最近研究
最新研究方向
随着大型语言模型在代码生成领域的广泛应用,如何有效评估和纠正模型生成的错误代码成为研究热点。COFFEE数据集聚焦于代码编辑反馈任务,提供了包含正确与错误代码对及其对应的黄金反馈和测试用例的高质量资源。当前前沿研究方向集中于利用该数据集训练模型自动生成细粒度的代码修复建议,结合测试用例驱动的方法提升反馈的准确性和可操作性。该数据集的发布推动了代码智能领域从单纯代码生成向智能代码审查与自动化调试的演进,为开发更可靠的编程辅助工具奠定了重要基础,尤其在教学场景和工业级代码质量保障中具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务