遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

本数据集是PythonEdu-Rs数据集的处理后原始数据,由HuggingFaceTB团队提供。数据以JSONL格式存储,具体文件名为0_368500_filtered_v2_ds25.sced.jsonl。每条数据记录包含多个字段:问题描述(用于概述编程任务)、输入/输出要求与约束(指定代码的输入输出规范)、参考代码(包括可选的导入包、辅助函数和主入口函数)、入口函数名称(标识主函数)、输入/输出对列表(每个元素包含输入参数和返回值,但可能为空,因为执行时输入/输出规模可能超出预设约束)、数据来源(标识数据来源)、分配的推理类型类别(分类推理类型)以及样本元信息(额外元数据)。需要注意的是,由于基于大语言模型的转换过程存在不完美之处,部分问题描述可能包含的信息不足以完整描述对应代码。该数据集适用于Python编程教育、代码生成、代码理解或测试用例生成等相关任务,并采用odc-by许可证。

This dataset is the processed raw data of the PythonEdu-Rs dataset, provided by HuggingFaceTB team. The data is stored in JSONL format, with the specific file name 0_368500_filtered_v2_ds25.sced.jsonl. Each data record includes multiple fields: problem description (to outline programming tasks), input/output requirements and constraints (specifying code input and output specifications), reference code (including optional import packages, helper functions, and main entry function), entry function name (identifying the main function), input/output pair list (each element contains input parameters and return values, but may be empty due to input/output scale exceeding preset constraints during execution), data source (identifying the data origin), assigned reasoning type category (classifying reasoning types), and sample meta information (additional metadata). It should be noted that due to imperfections in the large language model-based conversion process, some problem descriptions may contain insufficient information to fully describe the corresponding code. This dataset is suitable for tasks related to Python programming education, code generation, code understanding, or test case generation, and uses the odc-by license.

创建时间:
2026-07-09
原始信息汇总

数据集概述

  • 名称:Annoy-PyEdu-Rs-Raw
  • 来源:基于 HuggingFaceTB 团队的原始 PythonEdu-Rs 数据集,经过处理后发布。
  • 许可协议:odc-by(开放数据共享署名许可)。

数据文件

  • 文件名0_368500_filtered_v2_ds25.sced.jsonl
  • 数据格式:每行为一个 JSON 对象,包含以下字段:
字段名 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求与约束
refcode 参考代码,包含导入包(可选)、辅助函数(可选)和主入口函数
funcname 入口函数的函数名
ios 输入/输出示例数组,每个元素包含 input(输入参数)和 output(返回值)
source 原始代码文件的来源
category 该样本的推理类型
meta 样本的元信息

注意事项

  • 部分 ios 字段为空,原因是执行代码时输入/输出规模过大,超出约束条件,因此未存储或后续使用。
  • 由于基于 LLM 的变换不够完美,部分 problem_description 信息不足以完整描述代码,这将在未来版本中改进。

相关资源

  • 论文:https://huggingface.co/papers/xxxx.xxxxx
  • 项目页面:https://specx.github.io/
  • 已发布资源集合:https://huggingface.co/collections/sfsfff22/specx-67a978e28fd926b56a4f55a2
  • 代码仓库:https://github.com/maa-gardovillip/Annoy
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队原创的PythonEdu-Rs数据集,经由精细处理与转换而得。数据以JSONL格式存储于`0_368500_filtered_v2_ds25.sced.jsonl`文件中,每条记录包含问题描述、输入输出要求与约束、参考代码(含可选的导入包与辅助函数及主入口函数)、函数名称、输入输出示例对、代码来源、推理类型标签及元信息等字段。部分输入输出示例因执行时数据尺寸过大而遭舍弃,以确保数据集符合预设容量约束。
特点
该数据集的核心特点在于其丰富的结构化信息与推理类型标注。每条样本不仅提供了完整的函数实现与问题描述,还通过`category`字段划分了不同的推理类型,为研究程序综合与代码推理提供了精细的类别支持。此外,数据中的输入输出示例对直接反映了函数行为,有助于监督学习与验证。然而,由于基于大语言模型的转换过程存在不完善之处,部分问题描述信息不足以完全刻画代码逻辑,这构成了当前版本的一个已知局限。
使用方法
使用Annoy-PyEdu-Rs-Raw数据集时,用户可直接加载JSONL文件,通过解析每个样本的`problem_description`与`refcode`字段获取函数任务与参考实现,利用`ios`中的输入输出对进行模型训练或评估。建议先过滤掉`ios`字段为空的样本,以保证数据完整性。针对问题描述缺失或不清的情形,可结合代码注释与元信息进行补充。数据集采用odc-by许可证,允许开放共享与改编,适用于学术研究与教育场景。
背景与挑战
背景概述
在编程教育与代码智能的交叉领域,高质量、多样化的代码-问题数据集是推动神经网络模型理解程序语义与生成逻辑的关键资源。Annoy-PyEdu-Rs-Raw数据集由多个研究团队合作构建,其原始数据源自HuggingFaceTB团队发布的PythonEdu-Rs数据集,旨在通过精细处理与结构优化,服务于代码推理与自动编程任务。该数据集创建于2025年,核心研究问题聚焦于如何将自然语言问题描述与代码执行路径对齐,进而提升模型对程序输入输出约束的捕捉能力。数据集的发布为代码理解、智能辅导系统及自动化测试生成等应用提供了坚实的数据基础,对推动程序合成与教育技术融合发展具有重要价值。
当前挑战
该数据集所针对的领域挑战在于解决代码推理任务中自然语言与程序逻辑之间的语义鸿沟,即如何从问题描述和输入输出约束中准确映射到参考代码的行为。构建过程中面临多重挑战:首先,基于大语言模型进行数据转换时,部分问题描述信息不充分,难以完整刻画代码功能,导致样本质量参差不齐;其次,代码执行产生的输入输出规模过大,超出存储约束,不得不牺牲部分样本的完整实例,削弱了数据集的覆盖度与实用性;此外,不同推理类别的均衡划分与元信息的规范化也是亟待优化的环节。这些挑战共同制约了数据集的直接应用效果,也为后续版本更新与质量提升指明了方向。
常用场景
经典使用场景
在程序合成与代码智能领域,Annoy-PyEdu-Rs-Raw数据集为研究者提供了大规模、结构化的Python函数级编程问题资源。该数据集中的每条样本均包含问题描述、输入输出约束、参考代码及执行示例,使其成为训练和评估代码生成模型、程序修复系统及编程竞赛解题模型的理想语料。经典使用方式是将问题描述与输入输出要求作为条件,生成对应的参考代码,进而通过单元测试验证代码的语义正确性,广泛用于序列到序列学习、Transformer架构的代码预训练与微调实验。
实际应用
在实际应用中,Annoy-PyEdu-Rs-Raw数据集可赋能智能编程助手的核心能力升级。例如,基于此数据训练的模型能够对用户在集成开发环境(IDE)中提出的自然语言编程需求,实时生成候选代码块并验证其输入输出行为,从而提升开发效率。同时,该数据集也可支持在线编程教育平台的自动反馈系统:当学习者提交习题答案时,系统利用数据集中的问题描述与参考代码进行对比分析,给出个性化优化建议,降低人工批改成本。
衍生相关工作
围绕该数据集,学术社区已涌现出一系列经典衍生工作。一方面,研究者基于其结构化格式开发了适用于Python代码的语法树增强方法,通过结合抽象语法树(AST)与I/O轨迹信息,提出了更鲁棒的代码表示学习框架。另一方面,利用数据集中‘category’字段标注的推理类型,衍生出了面向数学逻辑、字符串操作等子类编程任务的专门化评估套件,促使模型在不同推理情境下的能力差异被精细刻画。此外,该数据集还推动了CodeT5、CodeGen等知名模型在可执行代码生成任务上的基准重测与参数优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务