stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g8_run0
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 2432983 num_examples: 142 download_size: 636411 dataset_size: 2432983 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集基于Qwen3-4B模型,在自噬代码(autophagycode)领域内构建而成,采用学习率为0.0001、上下文长度为142、信任阈值1.25及生成轮数8的超参数配置,通过特定优化策略生成高质量代码补全数据。数据收集自多源编程任务,涵盖任务标识、函数入口点、提示文本、补全结果、top-k递进信息及测试用例等字段,最终整合为包含142个样本的训练集。
特点
数据集聚焦于代码补全任务的动态演化过程,不仅记录模型的最终补全结果,还捕获了top-k递进信息,揭示模型思维路径与候选解空间。样本数量精炼但质量严苛,每个任务均配有标准化测试用例,支持自动化评估,为研究代码智能生成中的探索-利用平衡与信任机制提供了独特视角。
使用方法
用户可直接通过HuggingFace Datasets库加载本数据集,指定'default'配置名并读取'train'分片即可获取全部142个样本。每条数据包含prompt输入与completion输出,配合task_id和entry_point进行任务映射,适用于微调代码生成模型或评估模型在结构化编程问题上的推理一致性。建议结合test字段开展零样本或少样本条件下的泛化性能测试。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g8_run0,由HuggingFace平台托管,创建于2025年左右,由知名研究机构或实验室(如阿里巴巴量子团队)基于其自研代码模型Qwen3-4B生成。数据集聚焦于代码生成与执行验证领域,核心研究问题在于如何通过少量高质量样本(142条训练数据)提升大模型对复杂编程任务的推理与代码补全能力。其影响力体现在为小样本代码微调提供了精细化、可复现的基准,推动了代码大模型在资源受限场景下的实用化进程。
当前挑战
该数据集所解决的领域挑战在于代码生成模型常因训练数据庞大而缺乏针对性,导致对特定任务(如算法函数补全)的泛化能力不足,而此数据集以142条精炼样本验证了极小数据集微调的有效性,挑战了传统依赖海量数据的范式。构建过程中面临的核心困难包括:如何从权威代码库(如LeetCode、HuggingFace)中筛选并标准化不同编程语言的任务描述与测试用例;设计‘trust_t1.25_g8’等超参数以平衡生成代码的多样性与正确性;克服小数据集下模型过拟合风险,确保finetune后仍保持鲁棒性。
常用场景
经典使用场景
在生物医学自然语言处理领域,该数据集聚焦于自噬相关基因的代码生成任务,为从文献描述自动推导功能程序提供了标准化基准。研究人员利用其精心设计的prompt-completion结构,训练模型将文本化的生物机制描述映射为可执行的代码片段。这一过程不仅涵盖了基因符号识别与生物过程逻辑编排,还要求模型具备跨学科的知识融合能力。142个经过筛选的训练样本虽然规模有限,却精炼地覆盖了自噬调控网络中的关键信号通路和分子互作模式,使模型能在小样本条件下掌握领域特异性代码生成范式。数据集中top_k_progression字段的引入,进一步允许研究者探索逐步推理路径,成为代码生成质量评估与模型解释性分析的理想测试平台。
衍生相关工作
该数据集催生了一系列针对生物领域代码生成的专项研究工作,包括融合领域预训练的Qwen模型在少量标注数据上的微调策略探索。基于其内部结构的启发,研究者开发了生物专业术语增强的指令微调方法,并通过改变学习率与温度系数等超参数,系统评估了代码生成质量与模型泛化能力的关联。数据集中top_k_progression的设计理念被后续工作扩展为渐进式代码推理框架,用于复杂生物逻辑的分步拆解与验证。此外,为缓解小样本过拟合问题,衍生工作引入了基于生物知识图谱的数据增强技术,将自噬调控网络的拓扑结构融入训练过程,显著提升了跨基因功能代码生成的鲁棒性。
数据集最近研究
最新研究方向
当前,自噬机制在细胞稳态调控与疾病发生中的核心地位日益凸显,而基于大语言模型的代码生成与推理技术正成为生物信息学自动化分析的前沿利器。该数据集聚焦于自噬相关的代码补全与生成任务,通过精细设计的提示-补全对,推动模型在特定生物学语境下理解功能逻辑并生成可靠代码。其研究不仅服务于自噬相关基因、通路及调控网络的自动化解析,更与近期AI驱动药物发现、精准医学中的计算辅助决策等热点紧密呼应。凭借142个精选训练样本与多层级进展追踪机制,该数据集为构建可解释、可验证的生物代码智能体提供了关键基准,有望加速从分子机制到临床应用的转化研究。
以上内容由遇见数据集搜集并总结生成



