遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集是PythonEdu-Rs数据集的原始数据,基于HuggingFaceTB团队的原始数据集进行处理后发布。数据以JSON Lines格式存储在文件`0_368500_filtered_v2_ds25.sced.jsonl`中,每条记录包含以下字段:problem_description(函数的问题描述)、io_requirements(输入/输出要求与约束)、refcode(参考代码,可包含导入包、辅助函数和主入口函数)、funcname(入口函数的名称)、ios(输入/输出对列表,每个对包含input和output,但部分可能因输入/输出大小过大超出约束而为空)、source(原始代码文件来源)、category(为该样本分配的推理类型)、meta(样本的元信息)。需要注意的是,由于基于大语言模型的转换不完善,部分问题描述可能包含信息不足的情况。该数据集适用于代码生成、函数理解、编程教育或相关任务的训练与评估。数据集采用odc-by许可证。

This dataset is the raw data of the PythonEdu-Rs dataset, which was processed and released based on the original dataset developed by the HuggingFaceTB team. The data is stored in the file `0_368500_filtered_v2_ds25.sced.jsonl` in JSON Lines format. Each record contains the following fields: problem_description (problem description of the function), io_requirements (input/output requirements and constraints), refcode (reference code, which may include import statements, helper functions, and the main entry function), funcname (name of the entry function), ios (list of input/output pairs, each containing input and output; some pairs may be empty due to their input/output size exceeding constraints), source (source of the original code file), category (reasoning type assigned to this sample), meta (meta information of the sample). It should be noted that due to imperfect large language model-based conversions, some problem descriptions may contain insufficient information. This dataset is applicable for training and evaluation of tasks including code generation, function understanding, programming education, and related tasks. The dataset is released under the ODC-By license.

创建时间:
2026-07-20
原始信息汇总

数据集:Annoy-PyEdu-Rs-Raw

基本信息

  • 数据集名称:Annoy-PyEdu-Rs-Raw
  • 来源:基于 HuggingFaceTB 团队的原始数据集 PythonEdu-Rs 处理得到
  • 许可证:odc-by

数据格式

数据文件为 0_368500_filtered_v2_ds25.sced.jsonl,每一行包含以下字段:

字段 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求和约束
refcode 参考代码(包括导入的包、辅助函数和主入口函数)
funcname 入口函数的函数名
ios 输入输出示例列表,每个元素包含 input(输入参数)和 output(返回值)
source 原始代码文件的来源
category 分配给该样本的推理类型
meta 关于该样本的元信息

注意事项

  • 部分 ios 为空,原因是执行代码时输入/输出数据量过大,超出约束要求,因此未存储或后续使用
  • 由于基于 LLM 的转换不够完美,部分问题描述未包含足够信息来描述代码,这将在未来工作中进一步优化
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队原始数据,经过筛选与转换构建而成。每条数据以JSON格式存储,包含问题描述、输入输出需求与约束、参考代码(含可选导入包和辅助函数)、入口函数名、输入输出样例对、代码来源、推理类型类别及元信息。部分输入输出样例由于执行时规模过大超出约束而被移除,未予保留。
特点
该数据集聚焦于编程教育场景,提供丰富的函数级编程问题与参考实现,覆盖多种推理类型。数据构建过程中引入了基于大语言模型的转换,但部分问题描述可能信息不足,无法充分描述对应代码,提示了未来优化的方向。数据集采用odc-by许可证,便于学术研究与开放使用。
使用方法
研究者可通过加载`.jsonl`文件中的每条记录,利用`problem_description`和`io_requirements`作为任务输入,结合`refcode`与`funcname`构建代码生成或理解任务。`ios`字段提供输入输出样例,可用于评估模型推理能力。由于部分样例缺失,使用时需注意过滤或补充,数据集适合用于程序合成、代码理解及教育场景的基准测试。
背景与挑战
背景概述
在程序合成与代码智能领域,高质量的标注数据是驱动模型能力提升的关键基石。Annoy-PyEdu-Rs-Raw数据集由HuggingFaceTB团队创建,源自其原始的PythonEdu数据集,旨在为研究者提供经过初步过滤与结构化的函数级编程问题资源。该数据集创建于近期,核心研究问题聚焦于将自然语言描述的问题陈述、输入输出约束与参考代码进行对齐,从而支持基于推理的代码生成与理解任务。数据集包含超过36万条样本,每条样本涵盖问题描述、输入输出要求、参考代码及元信息,为评估模型在复杂编程问题上的泛化能力提供了规模化基准。其影响力体现在为Python教育场景下的代码推理研究开辟了新方向,并促进了LLM在结构化任务中的细粒度评估。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题层面,现有的代码生成模型往往难以从含混的问题描述中准确推断函数行为,尤其当问题陈述因LLM转换不完善而信息缺失时,模型容易产生语义偏差,制约了在真实教育场景中的实用性;2) 构建过程中,部分样本的输入输出示例因执行时体积过大而被剔除,导致ios字段为空,削弱了数据集的完整性与监督信号密度;此外,数据转换环节依赖的自动生成流程引入噪声,如何设计更鲁棒的过滤机制与质量增强策略,成为提升数据集可靠性的关键瓶颈。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集为编程教育领域的研究提供了丰富而原始的标注资源,其核心应用场景聚焦于代码生成与推理任务的训练与评估。该数据集包含了大量函数实现问题,每个样本均包含详细的问题描述、输入输出约束以及参考代码,并按照推理类型进行了分类。研究者可基于这些结构化信息,构建或微调大型语言模型,使其能够理解编程问题并生成符合特定约束的正确代码,从而推动代码智能合成技术的边界。
衍生相关工作
围绕Annoy-PyEdu-Rs-Raw数据集,学术界已衍生出一系列经典工作。其中,研究者基于该数据集的推理类型分类体系,提出了面向代码问题的多步推理增强训练范式,显著提升了模型在复杂约束下的代码生成准确率。另有工作利用数据集中丰富的输入输出实例,设计出基于执行反馈的强化学习框架,使模型能够自主修正生成的代码错误。此外,该数据集也被用于评估大模型在少样本场景下的编程能力迁移效果,催生了多项关于提示工程与上下文学习的创新研究。
数据集最近研究
最新研究方向
该数据集聚焦于Python编程教育领域中的代码推理与合成任务,基于原始PythonEdu-Rs数据进行精炼与重构,旨在为大型语言模型在代码理解与生成方面提供高质量的监督训练样本。当前研究前沿侧重于利用大规模结构化代码数据提升模型对编程问题的语义解析能力,尤其是在输入输出约束与函数实现之间的逻辑映射上。随着LLM在自动编程辅助、教育智能辅导等热点应用中的广泛渗透,该数据集通过引入多样化的推理类型与元信息标注,为探索代码智能中的细粒度推理机制提供了重要支撑。其影响在于推动编程教育数据集的标准化与可复现性,为后续研究在数据质量与任务适配性上的优化奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务