遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是PythonEdu-Rs数据集的处理版本,源自HuggingFaceTB团队的原始数据,遵循Apache-2.0许可证。数据以JSON Lines格式存储,每个样本包含多个字段:problem_description(函数的问题描述)、io_requirements(输入/输出要求与约束)、refcode(参考代码,可包含导入包、辅助函数及主入口函数)、funcname(入口函数名称)、ios(输入/输出对列表,每个对象包含input输入参数和output返回值;部分ios可能为空,因执行时输入/输出规模过大超出约束而被省略)、source(原始代码文件来源)、category(样本的推理类型分类)、meta(样本的元信息)。数据集适用于代码生成、代码理解或教育相关任务,例如基于自然语言描述和约束生成Python函数。需要注意的是,由于基于大语言模型的转换过程不完善,部分问题描述可能缺乏足够信息,未来计划进行数据增强和版本更新。数据规模可能约为368,500个样本(基于文件名推断,但未在README中明确确认)。

This dataset is a processed variant of the PythonEdu-Rs dataset, originating from the raw data curated by the HuggingFaceTB team. It is licensed under the Apache-2.0 license, and users must comply with its terms while retaining attribution to the upstream source. The data is stored in the file `0_368500_filtered_v2_ds25.sced.jsonl` in JSON Lines format. Each sample contains the following fields: problem_description (problem description of the target function), io_requirements (input/output requirements and constraints), refcode (reference code, which may include package imports, auxiliary functions, and the main entry function), funcname (name of the entry function), ios (list of input/output pairs, where each object includes input parameters and output return values; some ios entries may be empty, as they were omitted due to oversized input/output scales exceeding execution constraints), source (source of the original code file), category (inference-type classification of the sample), and meta (meta-information of the sample). This dataset is suitable for tasks including code generation, code understanding, and educational applications, such as generating Python functions based on natural language descriptions and associated constraints. Please note that due to the imperfect large language model (LLM)-based conversion process, some problem descriptions may lack sufficient information, and data augmentation and version updates will be implemented in the future. The dataset is estimated to contain approximately 368,500 samples, which is inferred from the filename but not explicitly confirmed in the README.

创建时间:
2026-07-23
原始信息汇总

数据集概述

  • 数据集名称:Annoy-PyEdu-Rs-Raw
  • 许可证:Apache-2.0(沿用原始数据源许可证)
  • 相关资源
    • 论文:https://huggingface.co/papers/xxxx.xxxxx
    • 项目页面:https://specx.github.io/
    • 发布资源合集:https://huggingface.co/collections/dfdfdg5667/specx-67a978e28fd926b56a4f55a2
    • 代码仓库:https://github.com/BourjollyFobes/Annoy

数据集内容

  • 数据来源:基于 HuggingFaceTB 团队的原始 PythonEdu-Rs 数据集,经处理后发布的原始数据。
  • 数据文件:单文件 0_368500_filtered_v2_ds25.sced.jsonl
  • 数据格式:每条数据为 JSON 对象,包含以下字段:
    • problem_description:函数的问题描述
    • io_requirements:输入/输出要求与约束
    • refcode:参考代码(含可选的导入包、辅助函数和主入口函数)
    • funcname:主入口函数名
    • ios:输入/输出示例列表,每个示例包含 input(输入参数)和 output(返回值)
    • source:原始代码文件的来源
    • category:分配给该样本的推理类型
    • meta:样本的元信息

注意事项

  • 部分 ios 字段为空,原因在于代码执行时输入/输出尺寸过大,超出约束条件,因此未存储或后续使用。
  • 由于基于 LLM 的转换存在不完美之处,部分问题描述可能信息不足,无法完整描述代码。此问题留待后续数据增强和版本更新时解决。

许可证

  • 该数据集使用 Apache-2.0 许可证,使用时应遵守其条款,并在适用时保留上游/来源声明。
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队的原始PythonEdu-Rs数据集,在保留Apache-2.0许可协议的前提下,我们对其进行了直接发布而未引入新的数据集许可。该数据集的构建核心在于对源代码文件进行筛选与结构化处理,将每条数据整理为包含问题描述(problem_description)、输入输出需求与约束(io_requirements)、参考代码(refcode)、入口函数名(funcname)、输入输出样例(ios)、来源(source)、推理类型类别(category)及元信息(meta)的JSON格式,最终汇聚于0_368500_filtered_v2_ds25.sced.jsonl文件中。
特点
该数据集的一个显著特点在于其精细的标注体系,每个样本均附有推理类型标签(category),为代码理解与学习提供了清晰的分辨依据。然而,部分样本的输入输出样例(ios)因执行时数据规模过大而空缺,这一设计既反映了数据采集过程中的现实约束,也体现了对存储与使用效率的权衡。此外,基于大语言模型的转换尚不完美,导致部分问题描述难以充分诠释对应代码,这成为数据集未来迭代优化的核心方向。
使用方法
用户可通过加载0_368500_filtered_v2_ds25.sced.jsonl文件直接使用该数据集,每行独立的JSON对象可供灵活解析。数据集适用于代码理解、程序合成、教学内容挖掘等场景,使用者需遵循Apache-2.0许可条款,并在适当位置保留上游或源数据的版权声明。鉴于ios字段可能为空,实际应用时建议对缺失的输入输出样例进行过滤或额外提示处理,同时需警惕问题描述与代码间可能存在的语义鸿沟,这一局限性提示了后续人工校验或增强的必要性。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队的原始PythonEdu-Rs数据集,旨在为程序合成与代码推理研究提供高质量的原始数据。该数据集由相关研究团队于近期发布,核心研究问题聚焦于如何通过大规模、结构化的代码样本提升模型对编程问题的理解与生成能力。数据集中每一条样本包含问题描述、输入输出约束、参考代码及执行测试用例,为评估代码生成模型的性能与鲁棒性提供了标准化的基准。其采用Apache-2.0许可证,确保了数据使用的开放性与可复制性,对编程语言处理与自动化编程领域具有重要的推动作用。
当前挑战
该数据集所面临的挑战主要体现在两个方面。在领域问题层面,代码合成任务需要模型精准理解自然语言描述并生成可执行代码,但现有模型常因输入输出的复杂约束与高维空间问题而难以保证正确性。在构建过程中,部分样本的输入输出因规模过大而超过约束阈值,导致存储缺失;同时,基于大语言模型的转换方法存在缺陷,致使部分问题描述信息不完整,难以充分表达对应代码逻辑,这些不完善之处亟需通过后续的数据增强与版本更新来加以解决。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集在编程教育领域扮演着举足轻重的角色,其经典使用场景聚焦于为代码生成与程序合成任务提供高质量的监督信号。研究者常利用该数据集中丰富的函数级问题描述、输入输出规范与参考代码三元组,训练模型理解自然语言指令与代码实现之间的映射关系。通过将问题描述转化为可执行的函数代码,该数据集成为评估和提升大语言模型在Python编程任务上表现的重要基准。其原始数据的保存方式保留了对输入输出约束的严谨处理,使得执行驱动的模型训练更加可靠。
实际应用
在实际应用中,Annoy-PyEdu-Rs-Raw数据集赋能了多种教育科技产品的智能化升级。例如,编程学习平台可以利用该数据集训练模型,实现对学生代码的自动纠错、功能级代码补全以及基于自然语言描述的代码生成。此外,该数据集还可用于构建编程习题的自动解答系统,帮助教师快速生成针对性的练习样例。其开源许可(Apache-2.0)极大地降低了商业集成的门槛,使得从个性化编程辅导到企业级代码审查工具的开发都能从中获益,加速了人机协同编程的落地进程。
衍生相关工作
围绕Annoy-PyEdu-Rs-Raw数据集,一系列经典研究工作应运而生。例如,研究者基于其函数级三元组结构提出了改进的对比学习框架,用于增强代码表示模型对输入输出语义的捕捉能力;另有工作探索了利用数据集中多模态信息(描述与代码)进行程序综合的预训练策略。该数据集还催生了若干关于数据增强与噪声处理的工作,研究者通过分析其过滤后的空输入输出样例,设计出更鲁棒的执行特征化方法。这些衍生工作不仅深化了对代码智能训练范式的理解,也为后续如CodeBERT、CodeT5等模型的更优变体提供了数据层面的关键支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务