Annoy-PyEdu-Rs
收藏资源简介:
该数据集是Annoy项目中的PythonEdu-Rs子集,发布在Hugging Face平台,标识为sfsfff22/Annoy-PyEdu-Rs。它从完整数据集中提取,由于合作者合规要求仅公开此部分。数据生成完全基于大语言模型(LLM),使用DeepSeek-V2.5合成所有期望的响应,旨在克服传统方法在获取确定性反向函数和自然语言推理表达性方面的限制。数据集采用odc-by许可证。README未提供数据内容、具体规模、字段结构或适用任务的具体描述。
This dataset is the PythonEdu-Rs subset of the Annoy project, hosted on Hugging Face with the identifier sfsfff22/Annoy-PyEdu-Rs. It is extracted from the full dataset and made publicly available only in this portion due to compliance requirements from collaborators. The data generation is entirely based on large language models (LLMs), using DeepSeek-V2.5 to synthesize all desired responses, aiming to overcome the limitations of traditional methods in obtaining deterministic inverse functions and natural language reasoning expressiveness. The dataset is licensed under odc-by. The README does not provide further descriptions of data content, specific scale, field structure, or applicable tasks.
数据集概述
- 数据集名称:Annoy-PythonEdu-Rs
- 所属项目:Annoy(这是一篇论文的标题)
- 数据集链接:Annoy-PyEdu-Rs
- 原始数据处理后版本:Annoy-PyEdu-Rs-Raw
- 许可协议:odc-by
数据集背景与目的
该数据集是项目“Annoy”资源集合的一部分,专注于通过基于LLM的方法合成高质量响应。项目采用完全基于大语言模型(LLM)的方法,使用DeepSeek-V2.5合成所有期望的响应,因其性能顶尖且成本极低。数据集解决了两大挑战:
- 获得用于输入预测的确定性逆函数不切实际。
- 自动构建的轨迹受限于预设计模板,缺乏自由形式自然语言推理的表达力和泛化能力。
数据集内容说明
- 发布子集:当前页面发布的是完整数据集中的 PythonEdu-Rs 子集(受合作者合规要求限制,仅发布此子集)。
- 响应合成方式:全部响应由 DeepSeek-V2.5 生成,旨在提供可靠的执行轨迹作为回答。
相关资源
- 论文:Annoy Paper
- 项目页面:Project Page
- 发布资源集合:Released Resources
- 代码仓库:Repo
相关模型
项目中还发布了多个基于不同基础模型训练得到的模型,分为 Annoy 和 Annoy++ 两个变体,每个变体包含 Stage 1 和 Stage 2 两个训练阶段:




