遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

PythonEdu-Rs 数据集是一个从 HuggingFaceTB 团队原始数据集改编而来的处理版本,专注于编程教育场景下的推理任务。数据集以 JSONL 格式存储,每条记录包含以下字段:问题描述(problem_description)、输入输出要求与约束(io_requirements)、参考代码(refcode,包括导入包、辅助函数和主入口函数)、函数名(funcname)、输入输出示例列表(ios,可能为空)、代码来源(source)、推理类型(category)以及元信息(meta)。该数据集可用于训练或评估代码生成、程序合成、推理理解等任务。注意:部分样本的 ios 字段为空,原因是输入输出规模过大;部分问题描述可能因自动转换而信息不完整。数据集采用 ODC-BY 许可协议。

The PythonEdu-Rs dataset is an adapted version from the original dataset by the HuggingFaceTB team, focusing on reasoning tasks in programming education scenarios. It is stored in JSONL format, with each record containing the following fields: problem_description, io_requirements, refcode (including imported packages, helper functions, and main entry function), funcname, a list of input-output examples (ios, which may be empty), source, category (reasoning type), and meta. The dataset can be used for training or evaluating code generation, program synthesis, reasoning understanding, etc. Note: Some samples have an empty ios field due to large input-output sizes; some problem descriptions may be incomplete due to automatic conversion. The dataset is licensed under ODC-BY.

创建时间:
2026-08-16
原始信息汇总

Annoy: This should be a paper Title 数据集概述

数据集简介

该数据集是PythonEdu-Rs数据集的原始版本,由Assads1SAD团队发布,原始数据源自HuggingFaceTB团队的数据集。数据集与论文《Annoy》相关,并提供项目页面、资源集合和代码仓库等配套资源。

数据格式

数据集文件名为0_368500_filtered_v2_ds25.sced.jsonl,每一行包含以下字段:

字段 描述
problem_description 函数的问题描述
io_requirements 输入/输出要求和约束条件
refcode 参考代码,包含导入的包(可选)、辅助函数(可选)和主入口函数
funcname 入口函数的函数名
ios 输入/输出示例列表,包含输入参数和返回值
source 原始代码文件的来源
category 分配给样本的推理类型
meta 样本的元信息

数据特点与注意事项

  • 部分ios字段为空,原因是执行代码时输入/输出规模过大,超出约束要求,因此未存储或后续使用。
  • 由于基于LLM的转换不完美,部分问题描述可能未包含足够信息来描述代码,该问题留待未来版本改进。

许可证

该数据集采用 ODC-BY 许可证。

搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队发布的原始PythonEdu-Rs数据集,经过精细的筛选与重构,形成了一份面向程序合成与推理任务的高质量语料。每个样本以JSONL格式存储,包含问题描述、输入输出需求、参考代码、函数名、输入输出样例、原始代码来源、推理类型标注及元信息。构建过程中,对因输入输出规模超出预设约束而无法保留的样例进行了剔除,确保了数据的可用性与一致性。
特点
该数据集的一大特色在于其结构化的字段设计,不仅提供了详细的函数级问题描述与输入输出约束,还附带了完整的参考代码与调试样例,为模型学习提供了丰富的监督信号。同时,每个样本均被标注了对应的推理类型(category),便于研究者针对不同推理模式进行细粒度分析。尽管部分样例因规模限制缺少输入输出对,但数据集中还包含了原始的代码来源与元信息,为后续的数据增强与质量改进提供了可能。
使用方法
使用者可直接加载该JSONL文件,利用其提供的字段进行代码生成、程序修复或推理能力评估等任务。具体而言,可将问题描述与输入输出要求作为模型输入,参考代码作为目标输出,进行监督微调;亦可利用输入输出样例设计测试用例,进行零样本或少样本评估。数据集的Odc-BY许可允许广泛使用与二次开发,但需注意部分问题描述存在信息不完整的情况,建议结合原始代码与元信息进行必要的筛选或补充处理。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集由Assads1SAD团队于近期发布,旨在为程序合成与代码生成领域提供高质量的原始训练资源。该数据集源于HuggingFaceTB团队的PythonEdu-Rs数据集,经过精细的过滤与重构,生成了包含约36.85万条样本的版本。其核心研究问题聚焦于如何利用大规模、结构化的代码-输入输出对,提升大语言模型在代码推理与生成任务上的性能。作为SPECX项目的一部分,该数据集填补了现有资源在代码教育场景下精细化标注的空白,对推动代码智能领域的实证研究具有重要影响。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:代码生成与程序合成任务要求模型不仅理解语法,还需掌握逻辑推理与输入输出约束,而这一能力的训练数据往往难以大规模高质量获取。在构建过程中,团队遭遇了双重挑战:其一,原始数据经LLM转换后,部分问题描述信息不完整,无法完全对应代码逻辑,影响数据可用性;其二,部分样本因输入输出规模超出预设限制,导致`ios`字段为空,造成数据稀疏。此外,数据许可采用ODC-BY,虽利于开放共享,但也需在使用中注意合规性问题。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集是面向Python编程教育领域的原始数据资源,其核心内容为代码问题描述、输入输出要求、参考实现及测试用例的集合。该数据集常用于训练和评估代码生成模型,特别是在函数级代码合成任务中,模型需根据自然语言描述生成可执行的Python函数。此外,它也被用于代码理解、程序修复和单元测试生成等研究,为教育场景下的智能编程助手提供数据支撑。
实际应用
在实际应用中,该数据集可用于开发智能编程教学系统,为学习者提供即时反馈和代码纠错建议。企业可基于此构建代码自动补全工具或代码审查助手,提升开发效率。此外,教育机构可将其用于评估学生的编程能力,通过自动生成测试用例来验证代码的正确性,从而减轻教师负担,实现个性化学习路径的推荐。
衍生相关工作
基于该数据集,衍生了一系列相关工作,包括:构建更精细的代码生成评估基准,引入多语言或多轮对话的扩展版本;利用其结构化的输入输出对,开发了程序合成和程序修复的专项模型;同时,该数据集的原始版本也促进了数据增强方法的研究,如基于LLM的代码改写和去噪技术,这些工作共同推动了代码智能领域的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务