遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

PythonEdu-Rs数据集是一个基于HuggingFaceTB团队原始数据集处理而来的编程教育数据集,采用JSON Lines格式存储。每个样本包含八个关键字段:问题描述(problem_description)、输入输出要求与约束(io_requirements)、参考代码(refcode,包括可选的导入包、辅助函数和主入口函数)、入口函数名称(funcname)、输入输出示例列表(ios,每个示例包含输入参数和返回值,部分可能因数据量过大而为空)、数据来源(source)、推理类型分类(category)以及元信息(meta)。该数据集旨在支持代码生成、代码理解或编程问题求解等任务,特别适用于教育场景下的Python编程学习与评估。需要注意的是,由于基于大语言模型的转换过程存在局限性,部分样本的问题描述可能信息不足;同时,部分输入输出示例因规模超出限制而被留空。数据集采用odc-by许可证发布。

PythonEdu-Rs is a programming education dataset processed from the original dataset developed by the HuggingFaceTB team, stored in JSON Lines format. Each sample contains eight key fields: problem_description (for problem description), io_requirements (for input-output requirements and constraints), refcode (reference code including optional import packages, auxiliary functions and main entry functions), funcname (name of the entry function), ios (list of input-output examples, each example contains input parameters and return values, some of which may be empty due to excessive data volume), source (data source), category (inference type classification), and meta (meta information). This dataset is intended to support tasks such as code generation, code understanding or programming problem solving, and is particularly suitable for Python programming learning and assessment in educational scenarios. It should be noted that due to the limitations of the large language model-based conversion process, some samples may have insufficient problem descriptions; in addition, some input-output examples are left blank as their scale exceeds the limit. The dataset is released under the ODC-BY license.

创建时间:
2026-07-19
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Annoy
  • 发布机构:liufe7848
  • 许可证odc-by (Open Data Commons Attribution License)

数据来源

  • 本数据集是 PythonEdu-Rs 数据集的原始版本,原始数据集来自 HuggingFaceTB 团队。

数据格式

  • 数据文件为 0_368500_filtered_v2_ds25.sced.jsonl,每行包含一个 JSON 对象,其字段及含义如下:
字段名 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求与约束
refcode 参考代码,包含可选的导入包、辅助函数以及主入口函数
funcname 入口函数的函数名称
ios 输入输出示例列表,每个示例包含 input(输入参数)和 output(返回值)
source 原始代码文件的来源
category 分配给该样本的推理类型
meta 关于该样本的元信息

注意事项

  • 部分 ios 字段为空,原因是执行代码时输入/输出规模过大,超过了设定的约束条件,因此未存储或后续使用。
  • 由于基于 LLM 的转换尚不完美,部分问题描述可能不包含足够的信息来描述相应代码,该问题留待后续进一步完善。

关联资源

搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队的原始PythonEdu-Rs数据集,经过精细筛选与重构而成。数据以JSONL格式存储,每一行包含问题描述、输入输出需求与约束、参考代码(含可选导入包与辅助函数)、入口函数名、输入输出示例、代码来源、推理类型及元信息。构建中特别关注了代码执行时的输入输出规模问题,对超出约束的样本予以过滤,确保数据集的实用性与一致性。
特点
该数据集的特点在于其结构化与多维度信息标注。每个样本均提供清晰的函数问题描述、输入输出约束以及完整的参考实现,便于进行代码理解与推理任务。此外,数据集引入了推理类型分类,为不同认知层次的代码分析提供支持。值得注意的是,部分样本的输入输出示例为空,这源于执行时规模过大,体现了数据构建中的实际约束考量。
使用方法
数据集可用于训练与评估代码理解、代码生成及程序推理等任务。用户可直接读取JSONL文件,解析每条记录中的'problem_description'、'refcode'及'ios'字段,构建输入输出对或进行代码-描述匹配学习。因部分示例缺少输入输出,建议使用前根据任务需求进行过滤或预处理。数据集采用odc-by许可,支持开放共享与学术使用。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集诞生于大规模代码智能与教育领域的交叉研究背景下,由研究团队基于HuggingFaceTB团队的原始数据构建,旨在为程序综合与代码生成任务提供高质量的训练与评估资源。该数据集聚焦于函数级编程问题,通过结构化的描述、输入输出约束与参考代码,推动模型对函数语义与逻辑约束的理解。其发布依托于SPECX研究项目,并配有论文、项目页面与开源仓库,对代码智能领域的研究具有重要支撑作用,尤其是在教育场景下的自动编程辅助与代码理解任务中展现出广泛的应用潜力。
当前挑战
该数据集所解决的领域问题在于,现有代码生成数据集多缺乏对函数输入输出关系的严格约束与多样化推理类型的标注,导致模型难以学习到精确的编程逻辑。构建过程中面临的主要挑战包括:部分代码因输入输出规模过大而无法存储,造成示例缺失;大语言模型驱动的转换机制存在不完善之处,导致部分问题描述不足以准确反映代码功能,影响了数据质量与可用性。这些挑战提示了数据筛选、质量校验与规模控制之间的平衡难题,也为后续数据增强与版本迭代指明了方向。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集专为代码智能与编程教育领域的研究而构建,其经典使用场景在于为Python函数级别的程序合成与推理任务提供原始数据支撑。该数据集包含了问题描述、输入输出约束、参考代码及丰富的测试用例,研究者可将其用于训练或评估模型在给定功能描述下生成正确代码的能力,或通过输入输出示例进行程序语义的理解与泛化。由于数据来源具有教育背景,该数据集特别适合用于编程题目自动解答、代码补全以及基于规约的程序生成等方向的研究,为从自然语言需求到可执行代码的端到端映射提供了高质量的基准资源。
解决学术问题
该数据集聚焦于解决程序合成领域中数据稀缺与任务多样性不足的核心学术难题。通过提供结构化的函数定义、推理类型分类及大规模输入输出对,Annoy-PyEdu-Rs-Raw有效支撑了基于描述的代码生成、输入输出约束下的程序推理以及多类型编程逻辑的自动学习等研究方向。其意义在于,一方面填补了面向Python教育场景的高质量原始数据空白,使得模型能够从真实编程题目中提炼出可迁移的编码模式;另一方面,通过引入推理类型标签,推动了代码理解从表面语法向深层语义推理的跨越,为构建更具泛化能力的代码智能系统奠定了数据基础。
衍生相关工作
基于Annoy-PyEdu-Rs-Raw数据集,衍生了一系列开创性研究工作。在代码生成领域,研究者利用该数据集的原始代码与问题描述对,训练出能够理解复杂编程规约并生成正确函数体的神经模型;在程序推理方向,通过其丰富的输入输出约束,推动了少样本学习下的语义等价判定与程序修复方法的发展。此外,该数据集还为面向推理类型的代码表示学习提供了基准,催生了结合元信息与代码结构的预训练范式,如基于推理标签的多任务学习框架。这些工作不仅验证了数据集的实用价值,也进一步拓展了其作为基础资源在代码理解与自动编程研究中的影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务