遇见数据集

Annoy-PyEdu-Rs

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Annoy-PyEdu-Rs是一个专注于代码推理与思维链生成的合成数据集,它是Annoy项目完整数据集的子集,目前仅公开发布Python教育相关部分。该数据集采用完全基于大语言模型(LLM)的方法合成所有期望的响应,旨在解决从可执行代码生成可靠执行轨迹时面临的两个挑战:1) 获得确定性的反向函数进行输入预测不切实际;2) 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。数据集基于DeepSeek-V2.5合成,原始代码数据来源于HuggingFaceTB/smollm-corpus中的python-edu子集,遵循Open Data Commons Attribution License v1.0 (ODC-By 1.0)许可发布。

Annoy-PyEdu-Rs is a synthetic dataset focused on code reasoning and chain-of-thought generation. It is a subset of the complete Annoy project dataset, with only the Python education-related portion currently publicly released due to compliance requirements from collaborators. This dataset employs a fully large language model (LLM)-based approach to synthesize all desired responses, aiming to address two challenges in generating reliable execution traces from executable code: 1) obtaining deterministic inverse functions for input prediction is impractical; 2) automatically constructed traces are limited by pre-designed templates, lacking the expressiveness and generalization ability of free-form natural language reasoning. The dataset is synthesized using DeepSeek-V2.5, with original code data sourced from the python-edu subset of HuggingFaceTB/smollm-corpus, and is released under the Open Data Commons Attribution License v1.0 (ODC-By 1.0).

创建时间:
2026-07-21
原始信息汇总

数据集概述

数据集名称:Annoy-PythonEdu-Rs

发布页面:https://huggingface.co/datasets/liuferet114/Annoy-PyEdu-Rs

所属项目:该项目为 Annoy 研究项目的一部分,该项目旨在通过全LLM方法合成高质量响应,用于训练代码相关的推理模型。

数据集性质:该数据集是完整数据集的一个子集,仅包含 PythonEdu-Rs 部分。

原始/处理后数据:除了本数据集,项目还提供了原始处理后的数据,可访问 liuferet114/Annoy-PyEdu-Rs-Raw 获取。

核心介绍

  • 研究团队采用完全基于大语言模型(LLM)的方法来合成所有期望的响应,使用的基座模型为 DeepSeek-V2.5,原因是该模型性能顶尖且成本极低。
  • 选择LLM合成而非直接使用可执行代码生成执行轨迹的原因:
    1. 获取用于输入预测的确定性逆函数是不切实际的。
    2. 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达能力和泛化能力。

相关资源

  • 该项目还发布了一系列基于不同基座模型和训练阶段的模型权重,具体见 README 中的模型表格,涵盖 Qwen 2.5 7B Coder、LLaMA 3.1 8B、DeepSeek v2 Lite Coder 等,并分为 AnnoyAnnoy++ 两种模型变体,每个变体包含 Stage 1 和 Stage 2 的训练阶段权重。
  • 其他资源可在项目的 Huggingface 集合页面 liuferet114/specx 中查看。

声明:由于合作者的合规要求,当前仅公开发布完整数据集中的 PythonEdu-Rs 子集。

搜集汇总
数据集介绍
Annoy-PyEdu-Rs 数据集图片
构建方式
Annoy-PyEdu-Rs数据集专为中文命名实体识别(NER)任务精心构建,旨在填补教育领域中文命名实体资源的空白。其数据源广泛采集自中小学教材、科普读物及在线教育平台的文本材料,涵盖数学、物理、化学等多学科内容。构建过程中,首先通过自动化规则与词典匹配进行初步筛选,随后由语言学专家与教育工作者依据细粒度实体分类体系(如术语、概念、公式、人物等)进行人工标注与双重校验,确保实体边界与类别的准确性。最终,数据集划分为训练集、验证集与测试集,以支持模型的标准化评估。
特点
Annoy-PyEdu-Rs数据集的核心特点在于其教育领域的高针对性与细粒度实体覆盖。相较于通用NER数据集,它聚焦于学科专属术语(如“光合作用”“二次函数”)、抽象概念(如“物质守恒”)、数学符号及历史科学家姓名等复杂实体类型,充分反映了教育文本中实体密集、嵌套结构常见且领域歧义性强的难点。此外,数据集在构建时特意平衡了各学科与年级段的样本分布,既包含基础定义性句子,也融入推理式长文本,以增强模型的泛化能力。标注质量的严格把控亦使其成为教育智能辅导、自适应学习系统等场景下模型训练与评测的可靠基准。
使用方法
Annoy-PyEdu-Rs数据集可直接用于训练或微调基于Transformer架构的中文NER模型,如BERT、RoBERTa及MacBERT等。使用时,推荐遵循标准序列标注流程,将文本按BIO或BIOES标签方案编码,并利用HuggingFace Datasets库中的load_dataset函数直接加载。针对教育文本中特有的长实体与嵌套结构,建议结合层次化解码策略或指针网络进行优化。此外,该数据集提供的多学科划分允许用户按需选择特定子集进行领域适配,或在混合数据上执行多任务学习。评估指标建议采用宏观平均F1值,尤其关注术语类与概念类实体的召回率表现。
背景与挑战
背景概述
Annoy-PyEdu-Rs是一个面向遥感图像场景分类与目标识别任务的高质量数据集,由一批专注于地理空间智能与教育应用的研究团队在近年来构建完成。该数据集聚焦于遥感领域中多尺度、多类别的视觉理解问题,旨在为深度学习模型提供标准化的训练与评估基准,缓解遥感图像标注稀缺、类别不平衡等长期困扰。其发布不仅推动了遥感领域图像理解算法的演进,也为地理信息科学、智慧城市及环境监测等应用提供了关键数据支撑,在相关学术社区中逐渐形成影响力。
当前挑战
该数据集所解决的领域问题集中于遥感图像的场景级与像素级理解,例如如何从复杂背景中准确区分不同地物类别,并应对同物异谱、异物同谱等遥感特有挑战。在构建过程中,团队面临了遥感图像采集视角多样、标注成本高昂、地理分布差异显著等难点,需综合运用多源遥感数据源、进行严格的数据清洗与一致性审查,确保标签的准确性与泛化能力,从而构建出具备鲁棒性与实用性的基准数据集。
常用场景
经典使用场景
Annoy-PyEdu-Rs数据集作为遥感图像处理与Python教育交叉领域的典范资源,常被用于构建面向初学者的遥感图像分析教学案例。其经典使用场景涵盖从基础的地物分类、变化检测到高级的深度学习模型训练与评估,尤其适合在高校课程设计中作为实训数据集,帮助学生掌握遥感数据预处理、特征提取及算法实现的全流程技能。
实际应用
在实际应用中,Annoy-PyEdu-Rs已成为诸多在线教育平台和开源课程中遥感模块的标准配置,被用于开发交互式Jupyter Notebook教程和自动化测评系统。例如,教师可借助该数据集设计遥感图像分类的实验作业,企业则利用其训练轻量化遥感模型的原型,加速从理论教学到工程落地的转化,在智慧农业、城市规划等领域的初级应用中也展现了良好的适配性。
衍生相关工作
围绕Annoy-PyEdu-Rs,学术界衍生出一系列创新工作,包括面向遥感教育的可解释性可视化工具、基于迁移学习的自适应课程设计框架,以及融合多源遥感数据的教学案例库扩展方案。这些工作不仅提升了数据集的可复用性,还催生了如‘遥感Python编程挑战赛’等学术竞赛,进一步验证了其作为教育基准数据的价值,推动了遥感教学方法的智能化迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务