Annoy-PyEdu-Rs
收藏资源简介:
Annoy-PythonEdu-Rs是一个代码相关数据集,属于更大规模“Annoy”数据集的Python教育子集。该数据集的构建旨在通过生成可执行代码来创建可靠的执行轨迹作为模型响应,以解决传统方法中确定性反向函数不实用和预设计模板缺乏表达力与泛化能力的问题。为此,采用完全基于大语言模型(LLM)的方法,利用DeepSeek-V2.5合成所有期望的响应,兼顾高性能与低成本优势。由于合作者的合规要求,目前仅公开此PythonEdu-Rs子集。数据集关联多个训练模型,包括基于Qwen 2.5 7B Coder、LLaMA 3.1 8B和DeepSeek v2 Lite Coder等基础模型训练的“Annoy”和“Annoy++”版本,适用于代码生成、推理或教育相关任务的模型训练与评估。数据许可证为odc-by。
Annoy-PythonEdu-Rs is a code-related dataset, belonging to the Python education subset (PythonEdu-Rs) of the larger-scale Annoy dataset. The construction of this dataset aims to create reliable execution trajectories as model responses by generating executable code, addressing issues in traditional methods where deterministic inverse functions are impractical and pre-designed templates lack expressiveness and generalization capabilities. To achieve this, a fully large language model (LLM)-based approach is adopted, utilizing DeepSeek-V2.5 to synthesize all desired responses, balancing high performance with low cost. Due to compliance requirements from collaborators, only this PythonEdu-Rs subset is currently publicly available. The dataset is associated with multiple trained models, including Annoy and Annoy++ versions based on foundational models such as Qwen 2.5 7B Coder, LLaMA 3.1 8B, and DeepSeek v2 Lite Coder, suitable for model training and evaluation in code generation, reasoning, or education-related tasks. The data license is odc-by.
数据集概述
- 数据集名称:Annoy-PythonEdu-Rs
- 数据集链接:https://huggingface.co/datasets/liufe7848/Annoy-PyEdu-Rs
- 所属资源集合:该数据集是 SpecX 资源集合的一部分,相关资源可在 SpecX 集合页 查看。
数据集背景与构建方法
该数据集是面向 Python 教育领域(PythonEdu)的子集,用于支持“Annoy”项目的研究。数据集的构建采用基于大型语言模型(LLM)的合成方法,具体使用 DeepSeek-V2.5 生成所有期望的响应。采用此方法的原因如下:
- 拥有完整可执行代码理论上可以生成可靠的执行轨迹作为响应,但存在两个挑战:1) 获取输入预测的确定性逆向函数不现实;2) 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。
- DeepSeek-V2.5 性能顶级且成本极低。
相关资源
- 原始数据:经处理后的原始数据可在 liufe7848/Annoy-PyEdu-Rs-Raw 获取。
- 配套模型:该数据集与以下训练阶段的模型相关,均托管于 Hugging Face:
- 基础模型:Qwen 2.5 7B Coder
- Annoy Stage 1:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_stage1
- Annoy Stage 2:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec
- Annoy++ Stage 1:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_pp_stage1
- Annoy++ Stage 2:https://huggingface.co/liufe7848/qwen2.5-7b-coder_spec_pp
- 基础模型:LLaMA 3.1 8B
- Annoy Stage 1:https://huggingface.co/liufe7848/llama3.1-8b_spec_stage1
- Annoy Stage 2:https://huggingface.co/liufe7848/llama3.1-8b_spec
- Annoy++ Stage 1:https://huggingface.co/liufe7848/llama3.1-8b_spec_pp_stage1
- Annoy++ Stage 2:https://huggingface.co/liufe7848/llama3.1-8b_spec_pp
- 基础模型:DeepSeek v2 Lite Coder
- Annoy Stage 1:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_stage1
- Annoy Stage 2:https://huggingface.co/liufe7848/dsv2-lite-coder_spec
- Annoy++ Stage 1:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_pp_stage1
- Annoy++ Stage 2:https://huggingface.co/liufe7848/dsv2-lite-coder_spec_pp
- 基础模型:Qwen 2.5 7B Coder
许可协议
该数据集采用 odc-by 许可证。




