stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g8_run0
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 2815999 num_examples: 142 download_size: 738644 dataset_size: 2815999 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍
构建方式
该数据集名为autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g8_run0,聚焦于代码生成领域的微调与推理任务。构建过程以Qwen3-8B为基座模型,采用学习率为0.0001的优化策略,并引入信任阈值参数1.25及组数8的采样机制,通过自噬编码(autophagycode)方法对初始代码数据集进行迭代筛选与增强,最终生成包含142个训练样本的精炼集合。数据涵盖任务标识、函数入口点、提示词、补全结果及测试用例等关键字段,确保样本在代码逻辑与功能验证上的完备性。
特点
本数据集的核心特点在于其高度去冗余与针对性。仅142条样本的规模体现了极致的轻量化设计,通过信任阈值机制过滤低质量或噪声数据,保留高置信度代码片段。每个样本均包含从提示到补全的完整链条,以及top_k_progression字段,追踪模型在采样过程中候选方案的质量演进,为分析模型推理行为提供了独特视角。此外,测试字段的存在使得数据集天然适用于代码生成任务的自动化评估与对比。
使用方法
数据集以HuggingFace标准格式组织,默认配置下训练集数据位于data/train-*路径中,可直接通过datasets库加载。使用时需注意字段含义:task_id用于区分任务类型,entry_point标识函数入口,prompt作为输入提示,completion为目标输出,top_k_progression记录候选序列进展,test则提供了验证生成正确性的测试用例。推荐将数据划分为训练与验证子集,结合Qwen3-8B或其他代码模型进行有监督微调,并通过测试字段评估生成代码的功能正确性。
背景与挑战
背景概述
该数据集由autophagycode团队与D. Mercury合作创建,基于Qwen3-8B模型在特定超参数配置(学习率0.0001、训练轮数142、信任系数1.25、梯度累积步数8)下生成,聚焦于代码生成领域的自噬式进步学习。核心研究问题在于探索大规模语言模型在代码补全与生成任务中,如何通过自我迭代(即“自噬”机制)实现性能提升,而非依赖外部标注数据。该数据集包含任务ID、函数入口、提示文本、补全结果及测试用例等字段,共142个训练样本,对代码智能领域中的少样本学习与自主进化策略具有启发性意义,为理解模型内部知识迁移提供了实验性基础。
当前挑战
该数据集所解决的领域问题在于代码生成任务中模型对未见函数签名的泛化能力不足,传统监督学习依赖大量人工标注样例,而本数据集通过自噬式进步机制尝试降低数据需求,但面临模型生成代码中逻辑错误或语法不兼容的挑战。在构建过程中,主要挑战包括:1)确保142个样本在任务多样性与难度分布上的平衡性,避免对特定函数类型过拟合;2)优化信任系数与梯度累积参数以稳定自我迭代过程的信噪比,防止早期错误被固化;3)设计有效的顶部k进步策略(top_k_progression字段)以量化模型从简单到复杂任务的渐进学习轨迹,避免陷入局部最优解。
常用场景
经典使用场景
该数据集专为代码补全与程序合成任务而设计,尤其聚焦于自噬生物学领域的代码生成。其经典使用场景包括:基于任务标识(task_id)和入口函数(entry_point)的提示(prompt),要求模型生成完整的函数实现(completion)。同时,数据集通过top_k_progression字段记录模型生成过程中的渐进式改进,便于研究者分析代码生成的质量演化路径,是评估大语言模型在特定科学领域代码生成能力的标杆资源。
解决学术问题
该数据集直面大语言模型在专业科学领域代码生成中的两大核心挑战:领域特定语义理解与多步推理一致性。它通过提供142个精心设计的自噬相关编程任务,解决了现有通用代码数据集缺乏领域深度的痛点,使研究者能够量化模型在生物学概念编程匹配、复杂算法迭代优化等场景的表现。其意义在于推动代码智能从通用场景向垂直科学领域的渗透,为计算生物学与人工智能的交叉研究提供可复现的评估基准。
衍生相关工作
该数据集衍生了一系列开创性工作,包括:基于渐进式代码演进(top_k_progression)的强化学习微调策略研究,探索如何通过中间状态反馈优化生成质量;以及利用入口点(entry_point)进行少样本代码合成的方法论创新。此外,还有工作将其与自噬通路知识图谱结合,开发了混合推理框架。这些衍生研究不仅验证了数据集的有效性,更开创了领域代码生成中任务分解与增量学习的范式探索。
以上内容由遇见数据集搜集并总结生成



