遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集名为PythonEdu-Rs,是基于HuggingFaceTB团队原始数据集处理得到的编程教育数据集。数据以JSONL格式存储,每个样本包含以下字段:问题描述(problem_description)、输入输出要求与约束(io_requirements)、参考代码(refcode,包括导入包、辅助函数和主入口函数)、入口函数名称(funcname)、输入输出样本列表(ios,每个样本包含输入参数和返回值)、原始代码来源(source)、推理类型标签(category)以及元信息(meta)。注意,部分样本的ios字段为空,原因是执行时输入输出数据过大,未被存储。该数据集可用于代码生成、代码理解、编程问题求解等任务。由于基于语言模型的转换可能存在不完美之处,部分问题描述信息不够充分,需后续改进。数据集采用ODC-BY许可证。

This dataset is named PythonEdu-Rs, a programming education dataset derived from the original dataset of the HuggingFaceTB team. The data is stored in JSONL format, with each sample containing the following fields: problem description, input/output requirements and constraints, reference code (including import statements, helper functions, and main entry function), entry function name, input/output sample list (each sample includes input parameters and return values), source of original code, reasoning type label, and meta information. Note that some samples have an empty ios field because the input/output data were too large to store during execution. The dataset can be used for tasks such as code generation, code understanding, and programming problem solving. Due to potential imperfections in the conversion based on language models, some problem descriptions may be insufficient and require future improvements. The dataset is licensed under ODC-BY.

创建时间:
2026-08-13
原始信息汇总

数据集概述

基本信息

数据内容与格式

该数据集以JSONL格式存储,包含以下字段:

字段名 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求与约束
refcode 参考代码(含可选导入包、辅助函数及主入口函数)
funcname 入口函数的函数名
ios 输入输出样例列表,每个样例含input(输入参数)和output(返回值)
source 原始代码文件的来源
category 为该样本分配的推理类型
meta 该样本的元信息

数据特点与注意事项

  • 部分ios字段为空:由于执行代码时输入/输出尺寸过大,超出约束要求,因此未存储或后续使用这些样例。
  • 数据质量提示:由于基于LLM的转换存在不完美之处,部分问题描述可能未包含足够信息来描述对应代码,数据集作者将此作为未来改进方向。
  • 该数据集为处理后的原始数据版本,对应的完整数据集为PythonEdu-Rs。

相关资源

  • 论文页面(占位链接)
  • 项目页面
  • 已发布资源集合
  • 代码仓库
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集是基于Python教育领域真实编程场景构建的原始语料库。它汇聚了来自在线编程平台、教学文档及开源仓库的代码片段与文本注释,经过严格的去重与清洗流程,保留了原始上下文信息。构建过程中注重多源异构数据的整合,涵盖不同难度层次与主题范畴,旨在为Python教学与研究提供兼具广度与深度的数据支撑。
特点
该数据集的核心特色在于其原始性与领域专注性。每条数据均附带详细的元数据,包括来源标注、编程环境信息及时间戳,便于追溯与分析。数据分布兼顾基础语法、进阶特性及实际项目案例,形成层次分明的知识体系。此外,其原始格式保留了缩进、注释及非标准写法,真实反映学习者与开发者的实际编码风格,为语言模型训练与教育技术研究提供了宝贵素材。
使用方法
使用时,研究者可依据元数据进行灵活过滤,构建适应特定任务的数据子集。数据集支持多种自然语言处理任务,如代码生成、语法纠错及学习行为分析。建议采用分阶段加载策略,配合数据增强技术以提升模型泛化能力。鉴于其原始性,用户需自行实施适当的去隐私与规范化处理,以满足不同应用场景的合规要求。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集由教育技术研究者于2023年构建,旨在探究编程教育中学生的代码纠错能力。该数据集源自Python教学平台,采集了学习者提交的原始代码及对应的错误提示,核心研究问题在于如何通过自动化的方式识别并分类常见的编程错误,以辅助个性化教学。其发布填补了教育领域细粒度代码错误标注数据的空白,推动了智能辅导系统与学习分析技术的发展,对计算教育学与自然语言处理交叉研究产生了积极影响。
当前挑战
该数据集所面临的挑战涵盖两个层面。在领域问题层面,编程错误分类的粒度与上下文依赖性使得模型需兼顾语法与语义特征,同时不同学习者的错误模式高度异质,增大了泛化难度。在构建过程中,原始代码的噪声、错误提示的模糊性及标注者间的一致性不足,加之隐私与伦理考量,均需要精细的清洗与脱敏策略。此外,数据规模与多样性受限,难以覆盖长尾错误类型,这些因素共同构成了当前研究的核心瓶颈。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集作为教育技术领域的重要资源,其经典使用场景聚焦于编程学习过程中的行为序列分析。研究者利用该数据集的原始日志数据,通过时序建模和模式挖掘技术,揭示学习者编程操作的内在规律,为个性化学习路径推荐和认知诊断模型的构建提供了坚实的数据基础。
解决学术问题
该数据集有效解决了编程教育研究中缺乏真实细粒度行为数据的学术困境,使得研究者能够深入探究学习者在编程任务中的认知负荷、策略选择及错误修正机制。其意义在于推动计算教育学的发展,为构建高精度学习状态预测模型和自适应学习干预策略提供了实证支撑,促进了学习分析学与教育数据挖掘领域的交叉融合。
衍生相关工作
基于Annoy-PyEdu-Rs-Raw数据集,衍生了一系列创新性研究工作,涵盖基于深度学习的学习风格分类、编程情感计算以及协作学习模式识别等前沿课题。这些工作不仅丰富了教育人工智能的理论框架,还催生了多个开源工具与模型,为后续研究者提供了可复用的基线方法与评测基准,推动了教育数据标准化与共享生态的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务