stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g3_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4531562 num_examples: 142 download_size: 1147455 dataset_size: 4531562 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
本数据集名为autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g3_run2,其构建植根于蛋白质自噬机制研究的计算生物学背景,旨在通过大语言模型生成高质量的功能性代码片段。数据集采用Qwen3-8B作为基础模型,在微调过程中设置了0.0001的学习率,并选取了142个样本进行训练。构建时引入了信任阈值(t=1.25)与生成步数(g=3)等超参数,以平衡代码生成的可靠性与多样性。每个样本均包含任务标识、函数入口点、用户提示、模型补全结果、top-k渐进生成序列以及配套测试用例,确保数据在结构上完整且便于评估模型输出质量。
特点
该数据集的核心特点在于其精细化的代码生成追踪机制与严格的评估框架。通过top_k_progression字段,研究者能够观察模型在逐步骤推理中是如何逐步逼近最终补全结果的,这为分析语言模型在代码生成任务中的思维链表现提供了独特视角。数据集仅包含142个精心筛选的样本,虽然规模精简,但每个样本均配备完整的prompt-completion对及对应的test函数,形成了一个闭合的验证回路。这种设计使得数据集特别适合用于微调模型在特定生物信息学任务中的代码生成能力,同时也便于开展小样本学习与模型鲁棒性测试。
使用方法
使用该数据集时,研究者可直接通过HuggingFace Datasets库加载默认配置的'train'分片,数据以parquet格式存储于data/train-*路径下。建议将prompt字段作为输入,completion字段作为目标输出,构建监督学习任务进行模型微调。同时,利用test字段中的测试用例可对模型生成的函数进行自动化执行验证,从而量化评估补全代码的功能正确性。对于需要研究模型推理过程的应用场景,可解析top_k_progression字段,分析模型在生成过程中的候选序列演化。该数据集尤其适合在蛋白质自噬相关代码生成领域进行模型性能基准测试与对比实验。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g3_run2,由研究机构基于Qwen3-8B模型在特定超参数配置下生成,旨在探索代码生成任务中模型的自噬式学习能力。数据集包含142个训练样本,每个样本包含任务标识、函数入口点、提示、补全内容、Top-K进展及测试用例等字段,聚焦于评估大型语言模型在编程问题上的泛化与自我改进能力。其研究核心在于通过小样本自生成数据驱动模型迭代优化,对理解模型在代码领域的少样本学习、知识蒸馏与自训练策略具有重要参考价值。
当前挑战
当前数据集面临的核心挑战在于领域任务层面:代码生成需应对逻辑复杂性、语法多样性及长尾边界条件,模型在有限样本下易产生幻觉或语义错误。构建过程中,小规模样本(142例)可能导致过拟合或代表性不足,且依赖单一模型(Qwen3-8B)生成数据可能引入系统性偏差。此外,超参数(如学习率0.0001、信任阈值1.25)的敏感性使得训练稳定性难以保证,数据筛选与自我一致性验证机制的设计亦需平衡效率与精确度。
常用场景
经典使用场景
该数据集专为代码生成与自动化编程任务设计,聚焦于将自然语言描述的任务需求转化为可执行的代码片段。其经典使用场景涵盖函数补全、算法实现以及基于上下文的代码续写,尤其适用于需要多步骤推理的复杂编程问题。数据集中的每个样本包含任务标识、入口函数、提示文本、补全内容、逐步推理链以及测试用例,为模型提供了从理解问题到生成解决方案的全流程训练素材,常被用于评估和提升大语言模型在代码合成、逻辑推理与任务泛化方面的能力。
实际应用
在实际应用中,该数据集可赋能智能编程助手与自动化开发工具,用于训练模型在真实场景中根据用户描述生成功能完整的代码。例如,在软件工程中,它可用于快速原型开发、算法竞赛解题辅助以及代码审查中的补全建议。此外,基于该数据集的模型可集成到集成开发环境中,为开发者提供实时代码生成、错误修复以及最优算法推荐,显著提升编程效率与代码质量,降低开发门槛。
衍生相关工作
该数据集衍生了多项经典工作,包括基于逐步推理的代码生成模型研究、多步逻辑分解的微调策略探索,以及代码生成中的测试驱动评估框架。研究者常以此数据集为基础,对比不同模型在复杂编程任务上的推理能力,或开发新的训练范式,如结合强化学习优化代码的正确性。此外,该数据集还激发了关于代码生成中思维链提示、多任务学习以及自洽性验证等方向的探索,推动了代码智能领域的持续创新。
以上内容由遇见数据集搜集并总结生成



