遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

该数据集是“Annoy”项目资源的一部分,具体为“Annoy-PythonEdu-Rs”子集。数据集的构建旨在解决从可执行代码生成可靠执行轨迹作为模型响应时所面临的挑战:一方面,为输入预测获取确定性的反向函数并不现实;另一方面,自动构建的轨迹受限于预先设计的模板,缺乏自由形式自然语言推理的表达力和泛化能力。因此,研究者采用了一种完全基于大语言模型(LLM)的方法,利用性能顶尖且成本极低的DeepSeek-V2.5来合成所有期望的响应。由于合作者的合规要求,目前仅公开发布了完整数据集中的PythonEdu-Rs子集。该数据集遵循ODC-BY许可证。相关的原始处理数据也可通过指定链接获取。该数据集主要用于支持代码生成、程序推理、以及结合执行轨迹与自然语言解释的模型训练与研究。

This dataset is part of the Annoy project resources, specifically the Annoy-PythonEdu-Rs subset. Its construction aims to address the challenges of generating reliable execution trajectories from executable code as model responses: on one hand, obtaining deterministic inverse functions for input prediction is impractical; on the other hand, automatically constructed trajectories are limited by pre-designed templates, lacking the expressiveness and generalization of free-form natural language reasoning. Therefore, researchers adopted a fully large language model (LLM)-based approach, using the high-performing and cost-effective DeepSeek-V2.5 to synthesize all desired responses. Due to collaborators compliance requirements, only the PythonEdu-Rs subset of the full dataset is publicly released. The dataset follows the ODC-BY license. Related raw processed data is also available via specified links. It is primarily used to support model training and research in code generation, program reasoning, and the integration of execution trajectories with natural language explanations.

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称: Annoy-PythonEdu-Rs (Annoy-PyEdu-Rs)

发布机构: liufea154

所在平台: Hugging Face Datasets

许可证: ODC-BY

数据集内容

该数据集是完整数据集中的 PythonEdu-Rs 子集,属于一个更大的研究资源集合的一部分。由于合作方的合规要求,目前仅公开发布该子集。

数据构建

数据集采用 完全基于 LLM(大语言模型)的方法 进行合成,使用的模型为 DeepSeek-V2.5。选择该模型的原因在于其具有顶级性能且成本极低。

背景与动机

在理论上,拥有完整可执行代码可以生成可靠的执行轨迹作为响应,但面临两个挑战:

  1. 获得用于输入预测的确定性反向函数是不切实际的。
  2. 自动构建的轨迹受限于预先设计的模板,缺乏自由形式自然语言推理的表达力和泛化能力。

因此,研究者采用基于 LLM 的方法来合成所有预期的响应。

相关资源

关联数据集

相关模型

该数据集与一系列模型(Annoy 和 Annoy++)相关,这些模型基于不同的基座模型(Qwen 2.5 7B Coder、LLaMA 3.1 8B、DeepSeek v2 Lite Coder)训练,并分为 Stage 1 和 Stage 2 两个阶段。具体模型链接如下:

Annoy 模型:

基座模型 Stage 1 Stage 2
Qwen 2.5 7B Coder 模型链接 模型链接
LLaMA 3.1 8B 模型链接 模型链接
DeepSeek v2 Lite Coder 模型链接 模型链接

Annoy++ 模型:

基座模型 Stage 1 Stage 2
Qwen 2.5 7B Coder 模型链接 模型链接
LLaMA 3.1 8B 模型链接 模型链接
DeepSeek v2 Lite Coder 模型链接 模型链接

其他信息

搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
Annoy-PyEdu-Rs数据集是面向Python编程教育领域构建的高质量资源集合,其构建过程完全基于大语言模型(LLM)驱动的合成范式。鉴于完整可执行代码虽能生成可靠的执行轨迹作为回复,但存在逆向函数难以确定以及自动化轨迹受限于预设计模板、缺乏自然语言推理表达能力的问题,研究者采用DeepSeek-V2.5这一性能顶尖且成本极低的先进模型来合成所有预期回复。该数据集作为完整资源集合中的PythonEdu-Rs子集发布,旨在为编程教育场景提供兼具表达力与泛化能力的数据支撑。
特点
该数据集的核心特色在于其完全基于LLM的合成策略,有效规避了传统依赖可执行代码方法中逆向函数获取困难与模板化轨迹表达力不足的双重困境。通过选用DeepSeek-V2.5作为合成引擎,既保证了回复质量达到顶尖水平,又控制了构建成本。数据集的Python教育定位使其内容紧密围绕编程学习场景,能够为模型提供从代码理解到自然语言推理的全方位训练素材,同时遵循ODC-BY许可证开放共享,促进了学术研究与教育应用的良性发展。
使用方法
使用Annoy-PyEdu-Rs数据集时,可直接从HuggingFace平台通过链接'liufea154/Annoy-PyEdu-Rs'获取。该数据集适用于监督微调或作为评测基准,尤其适合训练编程教育场景下的代码理解与自然语言推理模型。用户还可选择访问经过原始数据处理的'liufea154/Annoy-PyEdu-Rs-Raw'版本进行定制化预处理。结合同项目发布的Annoy与Annoy++系列模型(如Qwen 2.5 7B Coder、LLaMA 3.1 8B等基座的两阶段训练版本),可系统性地探索从合成数据到模型部署的完整工作流。
背景与挑战
背景概述
Annoy-PyEdu-Rs数据集由liufea154等研究人员创建,旨在应对代码智能领域中自动化生成高质量执行轨迹的挑战。该数据集聚焦于Python教育场景,通过采用DeepSeek-V2.5等先进大语言模型合成响应,以突破传统模板化方法在自然语言推理表达力与泛化性上的局限。作为更大规模数据集的子集,其发布遵循ODC-BY许可协议,为代码理解与生成研究提供了标准化测试基准,推动了教育场景下代码数据集的构建范式。
当前挑战
该数据集所解决的领域问题在于:现有方法依赖完整可执行代码生成轨迹,但面临逆向函数难以确定及自动构建轨迹受限于预设计模板、缺乏自由形式自然语言推理的泛化能力。构建过程中的挑战包括:1) 需设计全LLM驱动的合成策略以规避模板束缚;2) 平衡数据规模与合成成本,选择DeepSeek-V2.5实现高性能与低开销的折中;3) 受协作方合规要求约束,仅能发布子集,限制了数据多样性与完整性。
常用场景
经典使用场景
在教育数据挖掘与编程教学研究领域,Annoy-PyEdu-Rs数据集专为探究大语言模型在编程教育中的推理与代码生成能力而设计。该数据集以Python编程教学为核心素材,通过构建高质量的代码执行轨迹与自然语言推理对,支撑模型在给定编程问题时生成兼具逻辑严谨性与可执行性的代码解答。经典使用场景包括评估和微调大语言模型在编程教育场景下的多步推理能力,以及对比不同基座模型(如Qwen 2.5、LLaMA 3.1、DeepSeek v2)在合成编程教学回复时的表现优劣。
衍生相关工作
受Annoy-PyEdu-Rs启发,研究者围绕大语言模型在编程教育中的推理能力展开了系列延伸工作。其中包括Annoy++系列模型的提出,通过两阶段训练策略进一步增强了模型在编程回复中的逻辑连贯性与代码准确性。相关工作还探索了将不同基座模型(如Qwen 2.5 Coder、DeepSeek v2 Lite Coder)与Speculative Decoding技术结合,以加速推理过程并保持回复质量。这些衍生工作共同构筑了从数据构建、模型训练到推理优化的完整研究链条,为编程教育AI的实用化奠定了坚实基础。
数据集最近研究
最新研究方向
在编程教育领域,大语言模型驱动的合成数据生成正成为前沿热点,Annoy-PyEdu-Rs数据集应运而生。该数据集聚焦于利用DeepSeek-V2.5等顶级模型,以全LLM方法自动合成高质量的程序执行轨迹与自然语言推理响应,突破传统模板化数据构建的局限。这一方向关联着代码智能与教育技术融合的潮流,通过释放无模板约束的、富有表现力的推理数据,为可执行代码理解与教学场景中的智能化辅导开辟新路径。其影响在于显著降低数据构建成本的同时,提升模型对程序逻辑的泛化理解能力,推动编程教育从静态范例向动态、交互式学习体验演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务