遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Annoy-PythonEdu-Rs 是 Annoy 项目发布的一个数据集子集,专注于 Python 教育场景。该数据集采用完全基于大语言模型(LLM)的方法,使用 DeepSeek-V2.5 模型合成高质量的响应,旨在解决可执行代码的确定性逆函数获取困难以及自动构造轨迹受限于预设模板、缺乏自然语言推理表达能力的问题。数据集内容可能包含指令-响应对或代码执行轨迹,用于训练模型在代码推理与教育任务上的表现。该数据集是完整数据集中的 PythonEdu 子集,此外还提供了原始处理数据(Annoy-PyEdu-Rs-Raw)。数据集许可为 deepseek。

Annoy-PythonEdu-Rs is a subset of the dataset released by the Annoy project, focusing on Python education scenarios. This dataset adopts a fully large language model (LLM)-based approach, using the DeepSeek-V2.5 model to synthesize high-quality responses, aiming to address the difficulty of obtaining deterministic inverse functions for executable code and the limitations of automatically constructed trajectories being constrained by preset templates and lacking natural language reasoning and expression capabilities. The dataset may contain instruction-response pairs or code execution trajectories, used for training models on code reasoning and educational tasks. This dataset is the PythonEdu subset of the full dataset, and also provides raw processed data (Annoy-PyEdu-Rs-Raw). The dataset license is deepseek.

创建时间:
2026-09-06
原始信息汇总

Annoy-PythonEdu-Rs 数据集详情

数据集概述

Annoy-PythonEdu-Rs 是 Annoy 项目资源集合中的一个子集,位于 Hugging Face 平台(sadSD13213/Annoy-PyEdu-Rs)。该数据集由 Annoy(一个推测为关于程序执行轨迹生成或代码智能的研究项目)发布,其中仅公开了 PythonEdu-Rs 子集,原因是合作方的合规要求限制了完整数据集的公开。

数据集来源与构建

该数据集采用 基于 LLM 的合成方法 生成,使用 DeepSeek-V2.5 模型进行响应合成。之所以选择该模型,是因为其具有顶级性能且成本极低。构建方法背景如下:

  • 虽然完整可执行代码理论上可以生成可靠的执行轨迹,但存在两个挑战:
    • 获取用于输入预测的确定性反向函数不切实际;
    • 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。
  • 因此,完全基于 LLM 的方法被用于合成所有目标响应。

关联资源

数据集相关

项目相关

  • 资源集合页面:https://huggingface.co/collections/sadSD13213/specx-67a978e28fd926b56a4f55a2
  • 项目主页:https://specx.github.io/
  • 代码仓库:https://github.com/cacde1/Annoy
  • 论文:https://huggingface.co/papers/xxxx.xxxxx(未提供具体论文编号)

配套模型

该数据集配套了在多种基础模型上训练的两个变体(AnnoyAnnoy++),每个变体包含 阶段 1(Stage 1)阶段 2(Stage 2) 的训练结果:

基础模型 Annoy(阶段 1) Annoy(阶段 2) Annoy++(阶段 1) Annoy++(阶段 2)
Qwen 2.5 7B Coder 🤗 🤗 🤗 🤗
LLaMA 3.1 8B 🤗 🤗 🤗 🤗
DeepSeek v2 Lite Coder 🤗 🤗 🤗 🤗

备注

  • 当前页面仅展示 PythonEdu-Rs 子集,完整数据集的其余部分因合规要求未公开。
  • 原始处理前的数据可通过上方链接另行获取。
搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
Annoy-PyEdu-Rs数据集的构建依托于先进的大语言模型DeepSeek-V2.5,通过全自动化的合成流程生成高质量的教育型Python代码与推理轨迹。鉴于直接利用可执行代码获取逆向函数不可行,且基于模板的自动构建轨迹在表达力与泛化性上存在局限,研究者转而采用完全基于LLM的合成策略。该策略首先收集Python教育领域的原始语料,随后借助DeepSeek-V2.5的卓越性能(其高性能与低廉成本为大规模合成提供了经济可行性)生成多样化的问答对与代码执行链条,最终经过清洗与格式化处理形成本数据集,确保内容既具备自然语言的流畅性,又蕴含严谨的逻辑推理。
特点
该数据集聚焦于Python编程教育领域,其核心特点在于响应完全由LLM合成,突破了传统模板限制,呈现出高度自然且多样化的推理表达,兼具泛化性与教育适用性。每条数据都模拟真实教学场景,包含问题描述、代码实现及详尽的执行轨迹,能够有效支撑代码生成与教学辅助等任务。由于合作伙伴的合规性要求,当前仅公开PythonEdu-Rs子集,但其覆盖的编程知识点广泛,难度层次分明,为学习者与研究者提供了丰富而精炼的资源,并可与原始处理数据(Raw版)结合使用,以挖掘更深层的教育洞见。
使用方法
数据集以标准的HuggingFace数据集格式发布,可便捷地通过datasets库加载,获取包含指令、代码与回复的完整语料。支持以监督微调或指令微调方式训练代码大模型,例如基于Qwen 2.5 Coder、LLaMA 3.1或DeepSeek V2 Lite等基础模型进行两阶段训练(Stage1和Stage2),以适应不同层次的编码能力培养。评测时可按题目难度进行划分,用于检验模型在Python编程教学场景下的生成质量与逻辑连贯性。同时,官方提供的原始处理后数据(Annoy-PyEdu-Rs-Raw)可辅助研究数据合成过程,便于定制化扩展或领域迁移。
背景与挑战
背景概述
Annoy-PyEdu-Rs数据集的创建源于大型语言模型在代码执行轨迹合成领域面临的深刻挑战,由研究团队于近期开发并发布。该数据集聚焦于Python教育场景下的代码推理,旨在通过全自动化的方式生成高质量的执行轨迹响应。依托DeepSeek-V2.5等高性能、低成本的先进语言模型,研究团队摒弃了依赖预定义模板的局限性,转而采用完全基于LLM的合成策略,以复现自然语言推理的灵活性与泛化能力。该数据集的发布对于推动代码智能、程序合成以及教育技术领域的发展具有潜在的重大影响,为构建更鲁棒、更具解释性的代码理解与生成系统提供了宝贵的资源基础。
当前挑战
该领域面临的核心挑战在于,即便拥有完整可执行的代码,也无法可靠地推导出生成该代码的逆函数,这限制了从代码到推理路径的直接建模。此外,自动构建的执行轨迹常受限于预置模板,缺乏自然语言自由推理的丰富表达力,难以泛化至复杂编程任务。在构建过程中,研究者需克服对大规模语言模型输出质量的依赖,确保合成轨迹的精确性与教育相关性,同时需应对不同基座模型(如Qwen、LLaMA、DeepSeek)在指令遵循与编程能力上的差异,并妥善处理合规要求,实现数据集的有限发布。
常用场景
经典使用场景
Annoy-PyEdu-Rs数据集聚焦于Python编程教育场景,旨在为代码生成与教学辅助提供高质量的指令-响应对。其经典使用场景包括:基于给定代码片段自动生成自然语言教学解释、构建编程问题解答系统、以及训练模型以理解代码逻辑并产出可读性强的技术文档。该数据集通过合成多样化的自然语言推理轨迹,弥补了传统代码执行路径模板化的不足,为提升大型语言模型在代码教育领域的表现提供了关键资源。
实际应用
在实际应用中,Annoy-PyEdu-Rs可用于开发智能编程辅导工具,如代码错误解析系统、个性化学习助手及交互式代码注释生成器。教育科技公司可借此训练模型,为学生提供即时的代码解释与建议,降低学习门槛。此外,该数据集还可赋能自动化代码审查与文档生成平台,提升软件开发的效率与质量,尤其在在线教育平台和开发者工具中展现广阔前景。
衍生相关工作
基于Annoy-PyEdu-Rs,衍生出一系列大型语言模型的专门变体,如Qwen2.5-Coder、LLaMA3.1和DeepSeek-v2-Lite-Coder的微调版本(包括Annoy和Annoy++两阶段训练)。这些工作探索了从通用代码模型到教育增强型模型的迁移路径,并引入了自博弈或双阶段训练策略。此外,该数据集激发了关于合成数据质量、自然语言推理轨迹生成及低成本高效模型训练的相关研究,为开源社区提供了丰富的对比资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务