遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

Annoy-PythonEdu-Rs 是一个专注于 Python 教育领域的代码推理数据集,是更大规模数据集的一个子集。该数据集由作者使用 DeepSeek-V2.5 大语言模型以完全基于 LLM 的方式合成响应而构建,旨在解决从完全可执行代码生成可靠执行轨迹时面临的两个挑战:一是获取确定性逆函数进行输入预测不可行,二是自动构建的轨迹受限于预定义模板,缺乏自由形式自然语言推理的表达力和泛化性。通过采用性能顶尖且成本极低的 DeepSeek-V2.5,数据集能够生成更丰富、更通用的响应。由于合作者合规要求,目前仅发布此 PythonEdu-Rs 子集。数据集采用 ODC-BY 许可协议。

Annoy-PythonEdu-Rs is a code reasoning dataset focused on the Python education domain, a subset of a larger dataset. It was constructed by the authors using the DeepSeek-V2.5 large language model to synthesize responses in a fully LLM-based manner, aiming to address two challenges when generating reliable execution traces from fully executable code: first, obtaining deterministic inverse functions for input prediction is infeasible; second, automatically constructed trajectories are limited to predefined templates, lacking the expressiveness and generalization of free-form natural language reasoning. By employing the top-performing and cost-effective DeepSeek-V2.5, the dataset can generate richer and more general responses. Due to collaborator compliance requirements, only this PythonEdu-Rs subset is currently released. The dataset is licensed under ODC-BY.

创建时间:
2026-08-16
原始信息汇总

数据集概述:Annoy-PyEdu-Rs

基本信息

  • 数据集名称:Annoy-PythonEdu-Rs(简称 Annoy-PyEdu-Rs)
  • 发布机构/作者:Assads1SAD
  • 许可证:ODC-BY
  • 数据集类型:教育领域Python相关数据集(PythonEdu-Rs子集)

内容简介

该数据集是 Annoy 项目资源集合中的一个子集,聚焦于Python教育场景。由于合作方的合规要求,目前仅发布完整数据集中的 PythonEdu-Rs 子集。数据集的构建采用完全基于大语言模型(LLM)的方法,使用 DeepSeek-V2.5 模型合成所需的全部响应内容,利用其高性能与低成本优势。

相关资源

关联模型

该数据集与多个模型相关,涵盖三种基础模型(Qwen 2.5 7B Coder、LLaMA 3.1 8B、DeepSeek v2 Lite Coder)在 Annoy 与 Annoy++ 两种方法下的两阶段训练版本:

设计动机

采用LLM合成方法的原因在于:1)直接获取确定性的逆向函数用于输入预测不可行;2)自动构建的轨迹受限于预设计模板,缺乏自然语言推理的表达力和泛化能力。

其他说明

该页面同时也是 Annoy 项目的资源集合入口,更多相关资源可查看 Released Resources 集合。

搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
该数据集名为Annoy-PyEdu-Rs,隶属于Annoy项目,专注于Python教育领域。在构建过程中,鉴于完整可执行代码虽然能生成可靠的执行轨迹作为响应,但存在逆向函数确定困难以及自动构建轨迹受限于模板、缺乏自然语言推理的灵活性与泛化能力等问题,数据集采用完全基于LLM的方法,利用DeepSeek-V2.5模型合成所有期望的响应。DeepSeek-V2.5在保持顶级性能的同时,成本远低于其他先进LLM,这使得大规模合成高质量数据成为可能。数据集的原始处理版本(Annoy-PyEdu-Rs-Raw)亦公开发布,以供研究者深入探索。
特点
Annoy-PyEdu-Rs数据集具有显著的特点。其内容覆盖Python教育场景,数据通过先进的大语言模型合成,确保了数据的高度多样性和自然语言表达的丰富性,克服了传统模板化数据生成的局限性。该数据集注重执行轨迹的可靠性与自然语言推理的结合,旨在提升模型在编程教育领域的理解和生成能力。此外,数据集遵循ODC-BY许可协议,允许开放共享,并特别提供原始数据版本,增强了透明度和可复现性。
使用方法
使用此数据集时,研究者可将其作为微调基座模型的训练语料,例如Qwen 2.5 7B Coder、LLaMA 3.1 8B以及DeepSeek v2 Lite Coder等。数据集支持多阶段训练流程(Stage 1和Stage 2),可分别用于模型的基础能力培养和特定任务增强。HuggingFace页面提供了详细的数据集链接和模型仓库,方便直接下载。同时,参考关联的论文和项目页面,可获取更全面的使用指导和基准结果,以促进在代码生成、教育辅助等应用中的有效利用。
背景与挑战
背景概述
Annoy-PyEdu-Rs数据集由Assads1SAD研究团队于2023年创建,旨在推动编程教育领域的语言模型推理能力研究。该数据集聚焦于Python教育场景,通过全LLM合成方法(基于DeepSeek-V2.5)生成高质量的执行轨迹与自然语言推理,以解决传统基于模板的合成方法表达力不足的问题。其核心研究问题在于如何利用大型语言模型构建兼具准确性与泛化性的教育型指令数据,从而提升模型在代码执行与推理任务上的表现。该数据集与Annoy/Annoy++模型系列紧密关联,其发布为编程教育领域的大模型微调提供了宝贵资源,对后续研究具有重要影响。
当前挑战
该数据集面临的挑战包括:1) 领域问题层面,编程教育需要模型具备从代码生成到执行逻辑的深度理解,而现有数据集多偏向静态代码或简单问答,难以覆盖完整执行轨迹与复杂推理;2) 构建过程中,获取确定性逆向函数以实现输入预测不切实际,且自动构造的轨迹受限于预设模板,缺乏自由形式自然语言推理的表达力与泛化性;3) 数据合成依赖高性能模型,虽DeepSeek-V2.5成本较低,但如何确保生成数据的多样性、准确性及避免偏差仍是一大难题;4) 受合作方合规要求,仅发布PythonEdu-Rs子集,限制了数据集的完整性与广泛应用。
常用场景
经典使用场景
Annoy-PyEdu-Rs数据集是专为编程教育领域设计的高质量资源,其核心用途在于为大型语言模型提供细粒度的代码执行轨迹与自然语言推理的配对样本。该数据集基于Python教育场景构建,涵盖了从基础语法到复杂算法的多层次编程问题,每条样本均包含完整的可执行代码、对应的执行轨迹以及详尽的自然语言解释。研究者可借助此数据集微调代码生成模型,使其在生成代码的同时具备逻辑推理与自我解释能力,从而显著提升模型在代码理解、调试和教学辅助等任务上的表现。
解决学术问题
该数据集直面当前代码生成领域的两大核心挑战:其一,从可执行代码反向推导输入或中间状态在工程上难以实现确定性映射;其二,模板化自动生成的执行轨迹缺乏自然语言推理的灵活性与泛化能力。通过采用完全基于LLM的合成策略,利用DeepSeek-V2.5的高性能与低成本优势,数据集提供了丰富、自然且多样化的代码-轨迹-解释三元组,有效解决了训练数据中推理链单一、表达僵化的问题,为构建具备可解释性的代码智能体奠定了数据基础。
衍生相关工作
该数据集的发布催生了一系列相关研究与实践。基于其构建的Annoy与Annoy++模型,分别通过两阶段训练策略,验证了在Qwen、LLaMA及DeepSeek等多样化基座模型上融入执行轨迹与自然语言推理的有效性。此外,该数据集促进了代码-语言联合表示学习、可解释代码生成、以及教育场景下LLM安全性等方向的研究,为后续探索代码执行轨迹与人类认知模式对齐、开发更高效的数据合成流水线提供了基准与启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务