遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

Annoy-PythonEdu-Rs是一个代码相关数据集,属于更大规模“Annoy”数据集的Python教育子集。该数据集的构建旨在通过生成可执行代码来创建可靠的执行轨迹作为模型响应,以解决传统方法中确定性反向函数不实用和预设计模板缺乏表达力与泛化能力的问题。为此,采用完全基于大语言模型(LLM)的方法,利用DeepSeek-V2.5合成所有期望的响应,兼顾高性能与低成本优势。由于合作者的合规要求,目前仅公开此PythonEdu-Rs子集。数据集关联多个训练模型,包括基于Qwen 2.5 7B Coder、LLaMA 3.1 8B和DeepSeek v2 Lite Coder等基础模型训练的“Annoy”和“Annoy++”版本,适用于代码生成、推理或教育相关任务的模型训练与评估。数据许可证为odc-by。

Annoy-PythonEdu-Rs is a code-related dataset, belonging to the Python education subset (PythonEdu-Rs) of the larger-scale Annoy dataset. The construction of this dataset aims to create reliable execution trajectories as model responses by generating executable code, addressing issues in traditional methods where deterministic inverse functions are impractical and pre-designed templates lack expressiveness and generalization capabilities. To achieve this, a fully large language model (LLM)-based approach is adopted, utilizing DeepSeek-V2.5 to synthesize all desired responses, balancing high performance with low cost. Due to compliance requirements from collaborators, only this PythonEdu-Rs subset is currently publicly available. The dataset is associated with multiple trained models, including Annoy and Annoy++ versions based on foundational models such as Qwen 2.5 7B Coder, LLaMA 3.1 8B, and DeepSeek v2 Lite Coder, suitable for model training and evaluation in code generation, reasoning, or education-related tasks. The data license is odc-by.

创建时间:
2026-07-19
原始信息汇总

数据集概述

  • 数据集名称:Annoy-PythonEdu-Rs
  • 数据集链接:https://huggingface.co/datasets/liufe7848/Annoy-PyEdu-Rs
  • 所属资源集合:该数据集是 SpecX 资源集合的一部分,相关资源可在 SpecX 集合页 查看。

数据集背景与构建方法

该数据集是面向 Python 教育领域(PythonEdu)的子集,用于支持“Annoy”项目的研究。数据集的构建采用基于大型语言模型(LLM)的合成方法,具体使用 DeepSeek-V2.5 生成所有期望的响应。采用此方法的原因如下:

  • 拥有完整可执行代码理论上可以生成可靠的执行轨迹作为响应,但存在两个挑战:1) 获取输入预测的确定性逆向函数不现实;2) 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。
  • DeepSeek-V2.5 性能顶级且成本极低。

相关资源

  • 原始数据:经处理后的原始数据可在 liufe7848/Annoy-PyEdu-Rs-Raw 获取。
  • 配套模型:该数据集与以下训练阶段的模型相关,均托管于 Hugging Face:
    • 基础模型:Qwen 2.5 7B Coder
      • Annoy Stage 1:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_stage1
      • Annoy Stage 2:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec
      • Annoy++ Stage 1:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_pp_stage1
      • Annoy++ Stage 2:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_pp
    • 基础模型:LLaMA 3.1 8B
      • Annoy Stage 1:https://huggingface.co/liufe7848/llama3.1-8b_spec_stage1
      • Annoy Stage 2:https://huggingface.co/liufe7848/llama3.1-8b_spec
      • Annoy++ Stage 1:https://huggingface.co/liufe7848/llama3.1-8b_spec_pp_stage1
      • Annoy++ Stage 2:https://huggingface.co/liufe7848/llama3.1-8b_spec_pp
    • 基础模型:DeepSeek v2 Lite Coder
      • Annoy Stage 1:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_stage1
      • Annoy Stage 2:https://huggingface.co/liufe7848/dsv2-lite-coder_spec
      • Annoy++ Stage 1:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_pp_stage1
      • Annoy++ Stage 2:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_pp

许可协议

该数据集采用 odc-by 许可证。

搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
Annoy-PyEdu-Rs数据集依托大型语言模型DeepSeek-V2.5进行完全自动化的响应合成。鉴于完整的可执行代码虽能生成可靠的执行轨迹,但面临确定性逆函数不可得及自动生成轨迹受制于预设模板、欠缺自由文本推理的泛化性等挑战,研究团队采用基于LLM的合成策略。该数据集作为完整资源集合的子集,仅发布PythonEdu-Rs部分,其原始数据亦通过HuggingFace平台开放访问。
特点
该数据集的突出特性在于其完全基于顶尖性能且成本低廉的DeepSeek-V2.5模型进行响应合成,避免了传统模板化方法的局限,赋予数据以自由形式的自然语言推理能力,从而提升了表达的丰富性与泛化性。作为Python教育领域的资源子集,它聚焦于编程教学场景,为后续模型训练提供了高质量的监督信号。
使用方法
使用者可通过HuggingFace数据集页面直接下载Annoy-PyEdu-Rs数据集及其原始版本。该数据集适用于对大型语言模型进行两阶段微调,具体可结合配套发布的Annoy与Annoy++系列模型(基于Qwen 2.5 7B Coder、LLaMA 3.1 8B及DeepSeek v2 Lite Coder)进行训练与评估。数据集采用odc-by许可证,允许遵循开放数据共享协议进行学术研究与开发应用。
背景与挑战
背景概述
Annoy-PyEdu-Rs数据集由香港理工大学等机构的研究团队于2025年发布,旨在解决大型语言模型在代码执行轨迹合成中的核心研究问题。该数据集聚焦于Python教育领域,通过完全基于LLM的方法利用DeepSeek-V2.5合成高质量的响应数据,以克服传统方法依赖预设计模板的局限性。作为SPECX项目的一部分,Annoy-PyEdu-Rs为代码智能领域提供了新的训练资源,推动了自然语言推理与代码执行轨迹融合的研究方向,对提升LLM在编程教育场景中的可解释性和泛化能力具有重要影响。
当前挑战
该数据集所解决的领域挑战在于:传统上,虽然完整可执行代码可生成可靠的执行轨迹作为响应,但获取确定性的逆向函数用于输入预测不可行,且自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理所需的表达力和泛化性。在构建过程中,研究团队采用完全基于LLM的方法合成所有响应,但面临如何在高性能与低成本之间取得平衡的挑战,最终选择DeepSeek-V2.5作为生成模型。此外,因合作者的合规要求,数据集仅发布其子集,限制了数据的完整性和多样性。
常用场景
经典使用场景
Annoy-PyEdu-Rs数据集专注于Python编程教育领域的推理增强,其经典使用场景是作为大型语言模型(LLM)在代码生成与推理任务上的微调与评估基准。该数据集由全LLM方法合成,利用DeepSeek-V2.5生成高质量的编程问题与对应的推理轨迹,覆盖从基础语法到算法实现的多种难度层次。研究者可借助该数据集训练模型在给定代码片段或自然语言描述下,生成精确、可执行的Python代码,并附带清晰的逻辑推理过程。其设计理念强调将代码执行的确定性优势与自然语言推理的灵活性相结合,为提升LLM在编程教学、自动化代码修复等场景中的表现提供了标准化测试环境。
衍生相关工作
围绕Annoy-PyEdu-Rs已衍生出一系列创新性研究工作,主要体现在两阶段训练框架(Stage 1与Stage 2)的探索,以及Annoy与Annoy++两种增强策略的对比。基础模型如Qwen 2.5 7B Coder、LLaMA 3.1 8B及DeepSeek v2 Lite Coder均被用于验证该数据集在不同架构上的通用性。相关工作进一步探究了推理轨迹的多样性与代码执行一致性的平衡,例如通过Annoy++引入更鲁棒的噪声处理机制以提升模型在复杂逻辑下的稳定性。这些衍生成果不仅验证了数据集的高质量与可扩展性,还为后续研究提供了分阶段预训练的基准,使得该资源成为编程教育领域大模型优化的重要参考体系。
数据集最近研究
最新研究方向
在人工智能与编程教育深度融合的前沿浪潮中,Annoy-PyEdu-Rs数据集聚焦于基于大语言模型的代码执行轨迹推理与教学响应合成。该数据集摒弃了传统依赖预定义模板的轨迹自动构建范式,转而采用完全由LLM驱动的合成策略,借助DeepSeek-V2.5的卓越性能与极低成本,突破性地实现了从可执行代码到自由形式自然语言推理的高质量映射。这一创新方向精准回应了当前编程智能辅导系统中普遍存在的响应泛化性不足与模板僵化问题,为构建更具表达力与适应性的代码教学Agent提供了关键数据基础设施,对推动个性化编程教育的智能化跃迁具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务