遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

Annoy-PythonEdu-Rs是一个专门用于代码生成或编程教育任务的数据集,属于更大规模Annoy数据集的子集。由于合作者的合规要求,目前仅公开了PythonEdu-Rs部分。该数据集采用完全基于大语言模型(LLM)的方法合成所需响应,具体使用DeepSeek-V2.5模型进行生成,这种方法在保证高性能的同时具有较低成本。数据集采用odc-by许可证,并提供了经过处理的原始数据版本(Annoy-PyEdu-Rs-Raw)。

Annoy-PythonEdu-Rs is a dataset designed for code generation or programming education-related tasks, and it is a subset of the larger Annoy dataset. Due to compliance requirements from collaborators, only the PythonEdu-Rs portion is currently publicly released. The dataset employs a fully large language model (LLM)-based approach to synthesize the required responses, specifically using the DeepSeek-V2.5 model for generation, which ensures high performance while maintaining low cost. It is licensed under odc-by, and a processed raw data version (Annoy-PyEdu-Rs-Raw) is also provided.

创建时间:
2026-07-20
原始信息汇总

数据集概述

数据集名称: Annoy-PyEdu-Rs

所属项目: Annoy(论文标题)

发布平台: Hugging Face

许可协议: odc-by(开放数据共享署名许可)

数据集描述:

  • 该数据集是完整数据集的一个子集,仅包含 PythonEdu-Rs 部分。
  • 数据集的构建采用基于大语言模型(LLM)的合成方法,使用 DeepSeek-V2.5 生成所有期望的响应,原因在于该模型性能顶尖且成本极低。
  • 研究动机:拥有完整可执行代码理论上可以生成可靠的执行轨迹作为响应,但存在两个挑战:
    1. 获得用于输入预测的确定性逆函数不切实际。
    2. 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。

相关资源:

相关模型:

基础模型 Annoy Stage 1 Annoy Stage 2 Annoy++ Stage 1 Annoy++ Stage 2
Qwen 2.5 7B Coder 🤗 🤗 🤗 🤗
LLaMA 3.1 8B 🤗 🤗 🤗 🤗
DeepSeek v2 Lite Coder 🤗 🤗 🤗 🤗
搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
在代码执行轨迹可获取的基础上,为突破传统模板化数据合成方法的局限,该数据集采用基于大型语言模型的完全合成策略。利用DeepSeek-V2.5这一兼具顶尖性能与极低调用成本的模型,自动化地生成具有自由形态自然语言推理能力的响应数据。整个构建过程无需预先定义输入的反向映射函数,亦无需依赖固定的结构化模板,从而确保了生成数据在表达形式与泛化能力上的高度灵活性。
特点
Annoy-PyEdu-Rs数据集聚焦于Python教育场景下的推理数据,其核心特质在于完全由大语言模型合成的响应具备自然语言推理的流畅性与可迁移性。数据内容规避了传统自动构造轨迹中模板化表达的桎梏,呈现出更贴近人类思维过程的多样化推理路径。该数据集遵循odc-by许可协议开放使用,为代码智能与教育领域的研究提供了高质量的合成数据支撑。
使用方法
该数据集可直接作为模型微调的监督信号,用于增强代码相关任务中语言模型对执行逻辑的推理能力。用户可通过HuggingFace平台提供的链接(safaf4455/Annoy-PyEdu-Rs)获取结构化数据,同时亦可访问对应的原始处理版本(safaf4455/Annoy-PyEdu-Rs-Raw)进行数据预处理流程的复现。配合官方发布的阶段性模型权重,研究者能够灵活复现论文中的两阶段训练方案,或基于此数据集开展进一步的迁移学习与评测工作。
背景与挑战
背景概述
Annoy-PyEdu-Rs数据集创建于2025年,由safaf4455等机构研究人员推出,旨在通过全大语言模型(LLM)合成方法生成高质量的教育编程任务推理轨迹。该领域长期依赖自动化执行轨迹生成的模板化方法,限制了表达泛化能力。该数据集聚焦于LLM在学习场景下从给定代码推导输入与生成自然语言解释的核心研究问题,发布后为代码智能与教育AI交叉领域提供了新范式。其基于DeepSeek-V2.5的低成本合成策略显著降低了数据构建门槛,已在Qwen 2.5 Coder、LLaMA 3.1等基础模型上完成多阶段微调验证,对推动非确定性问题求解与可解释编程学习具有标杆价值。
当前挑战
该数据集解决的核心领域挑战包括:当代码可执行时,难以获得确定性反向函数来预测输入,且自动构建的轨迹受预设计模板约束,缺乏自然语言推理的自由表达与泛化能力。构建过程中面临的挑战在于:需采用纯LLM方法(如DeepSeek-V2.5)合成响应,既要保证生成轨迹的多样性与正确性,又要控制成本;此外,还需处理教育资源中Python代码的语义多样性,并在两阶段微调(Annoy与Annoy++)中平衡来源数据的引用合规性,最终仅发布PythonEdu-Rs子集作为开源典范。
常用场景
经典使用场景
Annoy-PyEdu-Rs数据集专为编程教育领域中的推理轨迹合成而生,其经典使用场景聚焦于利用大型语言模型(如DeepSeek-V2.5)生成高质量的、以自然语言表达的逐步推理过程。这些轨迹不仅包含可执行代码,还融入了自由形式的解释性文本,从而突破了传统预定义模板的局限性。研究者通常借助该数据集微调基础模型(如Qwen 2.5 7B Coder、LLaMA 3.1 8B等),使其学会在代码生成任务中同步产出逻辑连贯的推理链条,进而提升模型在复杂编程问题上的可解释性与准确性。该数据集为评估和优化代码智能体的教学能力提供了标准化基准。
衍生相关工作
围绕Annoy-PyEdu-Rs数据集,学术界已衍生出若干颇具影响力的工作。例如,研究者基于该数据集的推理轨迹合成思路,进一步提出了Annoy++模型,通过引入两阶段训练策略——先进行任务无关的轨迹预训练,再执行任务导向的微调——显著提升了代码生成的推理准确率。同时,该数据集还催生了针对不同基座模型(如Qwen 2.5 Coder、LLaMA 3.1、DeepSeek v2 Lite Coder)的系列适配工作,探索了架构差异对推理轨迹学习效果的影响。此外,部分工作借鉴其数据构造流程,将类似方法扩展至数学问题解答、科学计算等更广泛的推理密集型任务中,形成了跨领域的轨迹合成方法论体系。
数据集最近研究
最新研究方向
在代码智能与教育计算交叉领域,Annoy-PyEdu-Rs数据集聚焦于利用大语言模型合成教学级编程推理轨迹的前沿探索。该资源通过DeepSeek-V2.5的低成本高效特性,突破传统预定义模板对自然语言推理泛化能力的桎梏,为Python编程教育场景中的可解释代码生成开辟新径。其双阶段微调框架(Annoy与Annoy++)结合Qwen 2.5 Coder、LLaMA 3.1及DeepSeek v2 Lite Coder等基座模型,致力于弥合全量执行轨迹生成中逆向函数不可达与语义表达受限的双重困局。这一工作不仅响应了开源教育数据集在合规性上的现实诉求,更推动了自动化编程辅导系统从静态模板向动态生成式推理范式的跃迁,对降低编程教育门槛、提升代码理解透明度具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务