遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

PythonEdu-Rs数据集是一个专为教育场景设计的Python编程数据集,由HuggingFaceTB团队的原始数据集处理而成。数据以JSONL格式存储,主要文件为0_368500_filtered_v2_ds25.sced.jsonl。每条数据包含多个字段:problem_description(函数的问题描述)、io_requirements(输入输出要求与约束条件)、refcode(参考代码,可包括导入包、辅助函数和主入口函数)、funcname(入口函数名称)、ios(输入输出对列表,每个对包含input输入参数和output返回值,部分列表可能为空)、source(原始代码文件来源)、category(样本分配的推理类型)、meta(样本元信息)。需要注意的是,部分ios字段为空,这是因为在执行代码时,输入输出规模超出了预设约束条件,因此未被存储或后续使用。此外,由于基于LLM的转换过程不完善,部分问题描述可能信息不足,无法充分描述对应代码,这将在未来工作中进一步优化数据并更新版本。数据集采用ODC-BY许可证发布。

The PythonEdu-Rs dataset is a Python programming dataset designed for educational scenarios, processed from the original dataset by the HuggingFaceTB team. It is stored in JSONL format, with the main file being 0_368500_filtered_v2_ds25.sced.jsonl. Each data entry includes the following fields: problem_description (the problem description of the function), io_requirements (input-output requirements and constraints), refcode (reference code, which may include import packages, helper functions, and the main entry function), funcname (the name of the entry function), ios (a list of input-output pairs, each containing input parameters and output return values, with some lists potentially empty), source (the source of the original code file), category (the inference type assigned to the sample), and meta (sample metadata). It is important to note that some ios fields are empty because, during code execution, the input-output scale exceeded preset constraints and thus were not stored or used later. Additionally, due to imperfections in the LLM-based conversion process, some problem descriptions may contain insufficient information to fully describe the corresponding code, which will be addressed in future work to optimize the data and update to a better version. The dataset is released under the ODC-BY license.

创建时间:
2026-06-23
原始信息汇总

数据集详情:Annoy-PyEdu-Rs-Raw

基本信息

  • 数据集名称:Annoy-PyEdu-Rs-Raw
  • 数据集页面:https://huggingface.co/datasets/liu12123456/Annoy-PyEdu-Rs-Raw
  • 许可证:ODC-BY

数据来源

该数据集是 PythonEdu-Rs 数据集的原始版本,改编自 HuggingFaceTB 团队提供的原始数据集。

数据格式

数据集文件为 0_368500_filtered_v2_ds25.sced.jsonl,每一行的数据格式如下:

字段 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求和约束
refcode 参考代码(包括导入的包、辅助函数和主入口函数)
funcname 入口函数的函数名
ios 输入输出示例数组,包含 input(输入参数)和 output(返回值)
source 原始代码文件的来源
category 分配给该样本的推理类型
meta 关于该样本的元信息

注意事项

  • 部分 ios 字段为空,原因是执行代码时输入/输出数据量过大,超出约束条件,因此未存储或使用。
  • 由于基于 LLM 的转换过程不完善,部分问题描述可能不足以完整描述代码内容,未来将进行改进。
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集的构建源于对原始PythonEdu-Rs数据集的深度加工与整理。该原始数据集由HuggingFaceTB团队提供,本数据集在此基础上进行筛选与重构,形成了包含368,500条样本的过滤版本。每条样本以JSON格式存储,涵盖问题描述、输入输出约束、参考代码及其执行示例。数据集中部分样本的输入输出(ios)字段为空,是因为代码执行时生成的输入输出尺寸过大,超出了预设的存储约束,因此未被收录。这种构建方式确保了数据集在规模与质量之间取得平衡,同时保留了未来优化的空间。
特点
该数据集的核心特色在于其结构化与多维度的设计。每条样本包含完整的问题描述与输入输出要求,有助于训练模型理解代码的功能与边界条件。参考代码中不仅包含主入口函数,还可选地集成了导入的包与辅助函数,模拟真实的编程场景。此外,每个样本均标注了推理类型(category)与来源(source),为后续的细粒度分析提供了依据。值得注意的是,由于基于大语言模型的转换过程存在不完善之处,部分问题描述可能未能充分涵盖代码的全部信息,这一局限性也为数据集的持续改进指明了方向。
使用方法
该数据集适用于代码生成、程序合成与理解等自然语言处理任务的训练与评估。用户可直接加载JSON格式数据,根据问题描述与输入输出示例生成对应的参考代码,或基于代码推断其功能描述。由于数据集采用ODC-BY许可协议,用户可在遵守署名要求的前提下自由使用与分发。建议在使用时留意ios字段为空的情况,避免将空示例作为训练样本。对于问题描述不充分的部分,可结合其他数据源或人工标注进行补充,以提升模型的泛化能力。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集由LIU12123456团队基于HuggingFaceTB原始数据构建,旨在为编程教育场景下的代码推理研究提供大规模、结构化的原始数据资源。该数据集聚焦于程序合成与功能正确性验证的核心问题,通过整合函数问题描述、输入输出规范及参考实现,为评估大语言模型的代码生成与逻辑推理能力奠定了坚实基础。数据集发布于2025年,其设计理念与当前人工智能辅助编程教育的热点方向高度契合,有望推动代码智能合成、自动化测试生成及教育性代码评估等领域的发展,对促进教育信息化与人工智能交叉研究具有重要学术价值。
当前挑战
该数据集面临的领域挑战在于如何精准定义和表征程序推理任务,尤其是应对多样化问题描述与代码实现之间的语义鸿沟,以及处理复杂输入输出条件下的正确性验证问题。在构建过程中,主要挑战包括:一是基于大语言模型进行数据转换时,部分问题描述信息缺失,导致代码与描述对应关系不完整;二是执行代码时产生的巨大输入输出规模超出存储约束,致使部分样本的输入输出对为空,影响数据集的完整性与可用性。这些挑战亟待未来工作中通过优化转换策略与存储方案加以解决。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集专为Python编程教育场景设计,其经典用途在于构建和评估面向代码理解的机器学习模型。数据集中每一条样本都包含了问题的功能描述、输入输出约束、参考实现代码以及对应的测试用例,这为研究者提供了结构化的监督信号。借助这些丰富的信息,研究人员可以训练模型从自然语言描述中自动生成正确的Python函数,或者根据给定的输入输出对反向推断代码逻辑,从而在编程教学与自动评测系统中发挥核心作用。
解决学术问题
该数据集致力于解决编程教育领域中高质量标注数据匮乏的学术难题。传统上,构建大规模的“自然语言—代码”配对数据需要耗费大量人力,而Annoy-PyEdu-Rs-Raw通过自动化流程从原始代码库中提取并筛选出结构清晰的样本,显著降低了数据获取成本。它使研究者能够系统性地探索代码生成、程序合成以及基于输入输出示例的程序修复等经典问题,推动了教育场景下智能编程助手的学术进步,为自动化编程教学提供了坚实的数据基石。
衍生相关工作
基于Annoy-PyEdu-Rs-Raw数据集,研究者可衍生出一系列经典工作。一种典型方向是开发端到端的自然语言到代码翻译模型,利用其结构化的“问题描述-参考代码”配对进行监督训练。另一种相关工作是程序修复研究,借助数据集中的输入输出用例与参考实现,训练模型在代码生成错误时自动定位并修正Bug。此外,该数据集还可作为元学习与少样本学习的基准,评估模型在仅有少量样例条件下理解新编程任务的能力,从而推动低资源编程智能的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务