遇见数据集

Annoy-PyEdu-Rs-Raw

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是一个经过处理的PythonEdu-Rs数据集,源自HuggingFaceTB团队。数据以JSON Lines格式存储,每个样本代表一个Python编程任务,包含问题描述、输入输出要求、参考代码、入口函数名、输入输出对列表、原始来源、推理类型和元信息等字段。它专门设计用于支持代码生成、编程教育和代码理解等任务,特别是针对Python函数的输入输出推理。需注意部分样本的输入输出对可能为空,且问题描述可能因转换而信息不足。数据集采用odc-by许可证。

This dataset is a processed version of the PythonEdu-Rs dataset, with raw data sourced from the HuggingFaceTB team. The data is stored in JSON Lines format, and the primary file is named '0_368500_filtered_v2_ds25.sced.jsonl'. Each sample represents a Python programming task, containing the following fields: `problem_description`: the task's problem description, `io_requirements`: input-output requirements and constraints, `refcode`: reference code that may include package imports, helper functions, and the main entry function, `funcname`: the name of the entry function, `ios`: a list of input-output pairs, each containing input parameters and return values, with some pairs possibly empty, `source`: the original code source, `category`: the assigned inference type, and `meta`: sample metadata. This dataset is applicable to tasks such as code generation, programming education, or code comprehension, particularly for input-output reasoning of Python functions. It should be noted that the list of input-output pairs for some samples is empty, as the input-output size exceeded the constraint limits during code execution; furthermore, conversions based on Large Language Models (LLMs) may be imperfect, resulting in insufficient problem description information for certain samples. This dataset is released under the ODC-By license.

创建时间:
2026-07-23
原始信息汇总

数据集概述

  • 数据集名称:Annoy-PyEdu-Rs-Raw
  • 来源:改编自 HuggingFaceTB 团队的原始 PythonEdu-Rs 数据集
  • 许可协议:odc-by

数据格式

每个样本以 JSON 行格式存储,位于 0_368500_filtered_v2_ds25.sced.jsonl 文件中,包含以下字段:

字段 说明
problem_description 函数的问题描述
io_requirements 输入/输出要求和约束
refcode 参考代码,包括导入的包(可选)、辅助函数(可选)和主入口函数
funcname 入口函数名称
ios 输入输出示例列表,每个元素包含 input(输入参数)和 output(返回值)
source 原始代码文件的来源
category 分配给该样本的推理类型
meta 该样本的元信息

注意事项

  • 部分 ios 字段为空,原因在于执行代码后输入/输出规模过大,超出预设约束,因此未存储或用于后续处理。
  • 由于基于 LLM 的转换不完美,部分问题描述可能缺少足够信息来描述代码,开发者将此留作未来工作,以进一步优化数据并发布改进版本。

相关资源链接

  • 论文:https://huggingface.co/papers/xxxx.xxxxx
  • 项目页面:https://specx.github.io/
  • 发布资源集合:https://huggingface.co/collections/sdadafdaf4546/specx-67a978e28fd926b56a4f55a2
  • 代码仓库:https://github.com/ShieldAssistant/Annoy
搜集汇总
数据集介绍
Annoy-PyEdu-Rs-Raw 数据集图片
构建方式
Annoy-PyEdu-Rs-Raw数据集源自HuggingFaceTB团队的原始PythonEdu-Rs语料,经精细筛选与结构化处理后,形成以`0_368500_filtered_v2_ds25.sced.jsonl`为载体的高质量数据集合。每条样本以JSON格式存储,包含问题描述(problem_description)、输入输出需求与约束(io_requirements)、参考代码(refcode,涵盖可选导入包、辅助函数及主入口函数)、函数名(funcname)、多组输入输出样例(ios)、代码来源(source)、推理类型标注(category)以及元信息(meta)。部分`ios`因执行时数据规模超出约束限制而留空,确保了数据集的实用性与一致性。
特点
该数据集以细粒度推理类型标注为核心特色,每个样本均被赋予明确的`category`字段,便于下游任务中的分类与评估。数据格式高度结构化,函数签名、需求描述与输入输出样例相互关联,为代码理解与生成任务提供了翔实的上下文支撑。然而,由于大语言模型转换过程存在不完美之处,少量问题描述信息不足,这一局限已被标注为待改进方向,体现了数据集的可扩展性与自我迭代意识。
使用方法
数据集以逐行JSON格式存储于单个文件中,用户可借助标准JSON解析库(如Python的`json.loads`)逐行读取,按需提取`problem_description`、`refcode`、`ios`等字段。适用于代码生成、程序合成、函数级推理等场景的模型训练与评测。使用时需注意处理`ios`可能为空的情况,并可利用`category`字段对样本进行分层采样或条件过滤,以实现更精准的任务适配。数据集遵循odc-by开源许可协议,便于学术界与工业界自由使用与二次开发。
背景与挑战
背景概述
Annoy-PyEdu-Rs-Raw数据集由ShieldAssistant团队于近期构建并发布,旨在为编程教育领域中的代码合成与推理任务提供大规模、高质量的原始数据支撑。该数据集源自HuggingFaceTB团队所整理的PythonEdu-Rs数据,经过过滤与格式优化,每一条样本包含问题描述、输入输出规范、参考代码及其对应的测试用例,覆盖多种推理类型。研究团队期望通过这一资源推动基于大型语言模型的代码理解与生成研究,尤其是在教育场景下的自动反馈与评估能力。由于数据集以开放数据许可证(odc-by)发布,便于学术界与工业界复现与扩展,其影响力在编程教育、代码智能与LLM对齐研究领域初显。
当前挑战
该数据集面临的首要挑战是所解决的领域问题:在编程教育中,现有模型难以从自然语言描述中准确理解代码意图并生成符合约束的解决方案,尤其在输入输出约束复杂或计算量巨大的场景下表现欠佳。此外,构建过程中遭遇了显著困难:部分样本因代码执行时输入输出规模过大超出预设限制,导致对应的测试用例(ios字段)被迫留空,影响了数据完整性;同时,基于大语言模型的不完美转换使得一部分问题描述并未充分涵盖代码逻辑的细节信息,降低了样本的可用性。研究团队坦言这些问题尚待未来工作进一步优化与版本迭代。
常用场景
经典使用场景
Annoy-PyEdu-Rs-Raw数据集源自Python教育领域,旨在为程序合成与代码生成研究提供高质量的训练素材。该数据集的核心组成部分包括问题描述、输入输出规范、参考代码及多组输入输出样例,适用于监督学习范式下的代码生成任务。研究者可以通过问题描述与参考代码的配对,训练模型理解自然语言意图并生成对应函数实现。此外,数据集中包含的输入输出约束条件可用于评估生成代码的功能正确性,使其成为测试程序综合模型鲁棒性与泛化能力的理想基准。
解决学术问题
该数据集主要应对学术研究中代码生成模型的训练数据稀缺与质量不一的问题。通过提供结构化的函数级编程问题,它支持对代码理解与生成能力的细粒度评测,尤其关注输入输出约束下的逻辑推理任务。数据集的分类标签进一步推动了推理类型划分的研究,有助于探索不同思维模式对代码生成的影响。其发布填补了教育场景下高质量程序合成数据集的空白,为探究大语言模型在受限环境中的编程能力提供了重要工具。
衍生相关工作
该数据集衍生出一系列围绕程序合成与推理增强的经典工作。研究者基于其结构化特征,提出了针对输入输出示例的领域自适应训练策略,以及融合约束满足的代码生成方法。部分工作利用数据集的分类标签,探索了多任务学习框架下推理类型与代码质量之间的关联。此外,数据集中函数级粒度设计催生了若干关于细粒度代码评估指标的改进方案,推动了对模型逻辑推理能力的量化分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务