stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g5_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3175239 num_examples: 142 download_size: 782211 dataset_size: 3175239 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
本数据集名为autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g5_run2,其构建过程深度融合了代码生成与动态推理评估的先进理念。基于Qwen3-8B模型,采用学习率为0.0001的超参数设置,在包含142个样本的训练集上进行微调。每个样本均包含任务标识(task_id)、程序入口点(entry_point)、提示词(prompt)、模型生成的补全代码(completion)、基于信任阈值(trust=1.25)与生成序列数(g=5)机制筛选出的top-k逐步推理过程(top_k_progression),以及用于评估的测试用例(test)。这一精心设计的框架确保了模型产出既具有逻辑连贯性,又能够通过测试验证。
特点
该数据集的核心特色在于其构建的“信任驱动渐进推理”机制。通过设置信任阈值1.25与生成次数5,系统在推理过程中动态筛选出高质量的自洽推理路径,并以top_k_progression字段记录下来。这种设计不仅保留了模型在代码生成任务中的多步思考痕迹,还通过自洽性增强了结果的可靠性与鲁棒性。142个样本虽数量不多,但每个样本都凝聚了从提示到验证的完整闭环,形成了高质量的微调监督信号,特别适合用于强化模型的代码推理与逐步思考能力。
使用方法
数据集的使用路径明确且标准化。用户可通过HuggingFace Datasets库直接加载,指定配置为'default',并选取'train'分割。加载后,每个样本包含六个字段:task_id用于唯一标识任务,entry_point指定函数入口,prompt作为输入提示,completion为期望输出,top_k_progression提供推理过程的渐进式快照,test字段则包含用于功能性验证的测试用例。研究者可将其作为监督微调(SFT)数据集,利用completion和top_k_progression字段训练模型以提升代码生成的准确性与推理透明度。
背景与挑战
背景概述
自噬代码(AutophagyCode)数据集由上海人工智能实验室等机构的研究团队创建,旨在探索大语言模型在生物信息学领域的代码生成与推理能力。该数据集聚焦于细胞自噬相关任务,涵盖了从分子机制描述到算法实现的多元化编程挑战,其核心研究问题在于评估模型对专业科学概念的理解与代码转化能力。数据集包含142个训练样本,每个样本包含任务标识、函数入口、提示文本及完成代码等结构化信息,为模型在受限专业领域内的少样本学习与指令遵循能力提供了严苛测试基准。其发布推动了跨学科人工智能模型在生命科学计算任务中的应用探索,对计算生物学与自动化科研管线的发展具有重要启示意义。
当前挑战
该领域面临的核心挑战在于将抽象的生物自噬机理精准转化为可执行的算法逻辑,要求模型同时掌握分子生物学知识与编程规范,任何语义歧义都可能导致错误的功能实现。数据集构建过程中,研究人员需要从海量文献中筛选并标准化自噬相关任务,确保任务提示的科学准确性与代码完成的严谨性,同时控制样本规模以适配小样本学习场景。此外,top_k_progression字段的引入旨在评估模型逐步推理能力,但如何设计合理的进展度量标准以避免过拟合或欠拟合成为关键难点。测试集与训练集的结构差异进一步增加了模型泛化性能的评估复杂性。
常用场景
经典使用场景
该数据集聚焦于代码生成与程序合成领域的经典任务,特别适用于基于自回归语言模型的代码补全与函数级代码生成。依托Qwen3-8B架构并经过特定微调策略(学习率0.0001、温度系数1.25、束搜索规模5)的强化,数据集以任务标识、函数入口点、提示文本、补全结果及渐进式top-k探索路径为核心字段,为训练和评估模型在受限上下文中的精确代码生成能力提供了标准化基准。其142个高质量训练样本虽规模精巧,却足以支撑少样本学习与指令微调范式的验证,尤其在自动化编程辅助、算法实现评测等场景中扮演着测试床的角色。
实际应用
在实际应用层面,该数据集可直接服务于智能集成开发环境(IDE)中的代码自动补全与实时编程助手工具。基于其微调得到的Qwen3-8B模型能够根据函数入口点与注释提示,生成高质量的程序片段,显著提升开发者的编码效率。此外,该数据集还可用于教育场景中的编程作业自动批改与示例生成,帮助学习者快速理解算法实现;在软件工程领域,它支持自动化测试用例生成与代码审查辅助,降低人为错误率。通过渐进式top-k探索策略的引入,其应用能动态适配不同复杂度的编程任务,展现出在工业级代码生产流水线中的实用价值。
衍生相关工作
该数据集的涌现激发了多项衍生研究工作,包括但不限于对多粒度代码表示学习的探索、基于束搜索的渐进式解码策略优化,以及跨模型架构的代码生成迁移性分析。研究者借鉴其温度系数与束搜索规模的耦合设计,衍生出用于程序修复的对比学习框架;同时,该数据集提供的top-k渐进式标签示范了如何将解码中间结果作为监督信号,启发了后续关于逐步推理增强模型可解释性的工作。此外,基于其微调权重,多个团队开发了适配不同编程语言(如Python、C++)的专用代码生成变体,进一步拓展了代码智能的边界。
以上内容由遇见数据集搜集并总结生成



