stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g5_run0
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 6223813 num_examples: 142 download_size: 1515135 dataset_size: 6223813 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集源于对代码生成任务中多步推理过程的深度追踪,融合了Qwen3-4B模型在特定学习率(lr=0.0001)与生成配置(温度1.1,惩罚系数5)下的交互结果。通过收集任务描述(prompt)与程序补全(completion)数据,并引入top-k逐步推演(top_k_progression)的候选路径信息,构建出蕴含探索轨迹的高质量样本。数据共包含142个训练样例,涵盖编程问题的求解过程。
特点
数据集的核心特点在于其结构化地记录了模型解决代码任务时的渐进式推理链条,不仅包含标准的输入输出对,还保留了每一候选步骤的演化路径。这种设计使得数据能够反映模型在搜索空间中的探索行为,为研究代码生成中的决策机制与错误纠正提供了细粒度的观察窗口。所有样本均经过信任度阈值筛选(trust_t1.1),保证了数据质量。
使用方法
本数据集适用于训练或微调代码生成模型,尤其适合用于强化学习中的策略优化或模拟推理过程的行为克隆。使用时可直接加载train分片中的142条记录,通过解析task_id、entry_point等字段匹配对应编程问题,并结合top_k_progression序列还原多步决策历史。建议在训练时保持与原始生成一致的参数设置,以最大化数据特征的利用效率。
背景与挑战
背景概述
该数据集由自噬代码(AutophagyCode)团队于近期构建,专注于代码生成与大语言模型(LLM)的微调领域。其核心研究问题在于探索如何通过结构化任务数据提升模型在特定编程任务上的推理能力,尤其是在涉及信任约束与渐进式推理(progression)的场景中。数据集包含142个训练样本,每个样本涵盖任务标识、函数入口、提示、补全、顶级渐进路径及测试用例等字段,为评估模型在受限环境下的代码生成鲁棒性提供了独特基准。尽管规模较小,但其精细化的特征设计对推动低资源场景下的LLM微调研究具有启示意义。
当前挑战
当前数据集面临的首要挑战在于解决代码生成领域的信任与安全对齐问题:如何在模型输出中强制执行预定义的信任约束(如安全API调用或合规性检查),同时保持生成代码的功能正确性。构建过程中的挑战则源于样本稀缺性,仅142个实例难以覆盖多样化的编程范式与边界情况,而手动设计‘顶级渐进路径’(top_k_progression)字段的高标注成本进一步限制了数据扩展。此外,如何有效利用该数据集的六维特征(如将渐进路径与补全字段联合建模)以提升小样本学习效率,仍是亟待突破的技术瓶颈。
常用场景
经典使用场景
该数据集以编程竞赛题(如来自HumanEval、MBPP等基准的题目)为核心,每条样本包含任务ID、函数入口点、任务提示、标准解答、逐步推理过程以及单元测试代码。其经典使用场景在于微调代码生成模型,使模型学习从自然语言描述到可执行代码的映射,并掌握通过逐步推理生成高质量代码的能力。数据集设计精巧,尤其适合用于训练模型在复杂编程任务中模拟人类程序员的分步思考与调试过程,从而提升代码生成的准确性与鲁棒性。
实际应用
在实际应用中,该数据集主要服务于智能编程助手的开发与优化。基于该数据集微调的模型可嵌入各类集成开发环境(IDE)或在线代码平台,为开发者提供实时代码补全、错误诊断、自动化调试及教学辅助功能。例如,在面向初学者的编程教育场景中,模型能够分步骤解释代码逻辑,辅助学生理解复杂算法。在工业级软件工程中,该数据集训练的模型可辅助自动化单元测试生成与代码重构,显著提升开发效率与代码质量。
衍生相关工作
该数据集的构建理念直接催生了多个方向的后续工作。一方面,研究者借鉴其分步推理标注方式,开发了面向数学推理、逻辑证明等领域的结构化推理数据集,如MathCoder和StepCoder系列。另一方面,基于该数据集的微调方法被拓展至多语言代码生成、代码翻译与代码注释生成等任务。此外,该数据集还为“推理时思考”(thinking-in-reasoning)范式的实证研究提供了关键支撑,推动了OpenAI o1系列、DeepSeek-R1等模型在代码推理上的突破性进展,成为连接传统微调与新兴推理增强技术的桥梁。
以上内容由遇见数据集搜集并总结生成



