stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g7_run1
收藏数据链接:
官方服务:
资源简介:
该数据集包含142个训练样本,每个样本具有任务ID、入口点、提示、完成内容、top_k进展和测试字段,可能用于代码生成或任务完成相关的自然语言处理任务,如编程挑战或代码补全。数据以训练集形式提供,总大小约为3.5MB。
This dataset contains 142 training examples, each with fields such as task_id, entry_point, prompt, completion, top_k_progression, and test, likely used for code generation or task completion in natural language processing tasks, such as programming challenges or code completion. It is provided as a training split with a total size of approximately 3.5MB.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集基于代码生成任务构建,源自AutophagyCode领域的D Mercury基准测试。其构建过程依托Qwen3-4B模型,在初始学习率0.0001、温度参数1.25及生成候选数7等超参数配置下,经过142轮迭代训练生成。数据集中每条样本包含任务标识符、函数入口点、提示文本、补全代码、前k个候选序列进展记录以及测试用例等关键字段,形成了完整的代码生成与评估闭环。
特点
数据集呈现高度结构化与专业化特征。样本规模为142条,每条记录精心设计了六元组信息,不仅覆盖标准编程任务所需的提示与补全内容,还独创性地引入了top_k_progression字段用以追踪模型在生成过程中的候选演进路径,为剖析代码合成算法的内在机制提供了宝贵视角。
使用方法
使用者可通过HuggingFace平台直接加载该数据集。数据以train单一拆分形式提供,默认配置下支持按路径读取data/train-*文件。适用于训练或评估代码生成模型,尤其在需要分析模型在不同温度及候选数量下生成策略变化的研究场景中,该数据集可作为有效的验证与诊断工具。
背景与挑战
背景概述
在人工智能与代码生成领域,大语言模型在竞争性编程任务上的表现日益受到关注,如何评估模型在复杂算法问题上的推理与生成能力成为关键议题。autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g7_run1数据集由研究人员基于Qwen3-4B模型微调生成,创建于2025年,旨在通过142个精选的编程任务实例,探索模型在代码合成中的泛化性与鲁棒性。该数据集聚焦于核心研究问题:在低学习率(0.0001)与信任阈值(1.25)设置下,模型如何通过迭代优化生成高质量代码。其影响力体现在为代码智能领域提供了可复现的微调基准,推动了面向特定模型架构的数据集构建方法论。
当前挑战
该数据集所解决的领域挑战在于竞争性编程任务的代码生成,传统模型常因算法逻辑复杂度高而输出错误或不完整代码,该数据集通过引入top_k_progression与trust机制,旨在提升多步推理的准确性。在构建过程中,挑战主要体现在三个方面:其一,142个样本需覆盖多样算法类型(如动态规划、图论),同时确保任务间难度梯度合理,避免分布偏移;其二,超参数(学习率、信任阈值、生成轮次)的协同优化需大量实验以平衡模型性能与过拟合风险;其三,数据特征的完整性(如entry_point与test)要求自动化流程精准提取每条任务的结构化信息,对数据清洗与校验提出高要求。
常用场景
经典使用场景
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g7_run1,聚焦于自噬相关基因(autophagy-related genes)的编码任务,其经典使用场景在于训练和评估大型语言模型(如Qwen3-4B)对生物学序列的理解与生成能力。通过提供任务标识(task_id)、函数入口(entry_point)、提示(prompt)与补全(completion)等结构化字段,数据集特别适用于自噬通路中蛋白质编码序列的预测与纠错。研究者可利用其142个训练样本,结合顶部k值演化(top_k_progression)信息,探索模型在少量样本下的微调效果,推动生物信息学中序列到功能的映射研究。
解决学术问题
该数据集旨在解决自噬机制研究中序列注释不完整与功能预测精度不足的学术难题。传统方法依赖实验验证,耗时且高成本,而该数据集通过标准化编码任务,使语言模型能自动学习自噬蛋白的序列特征,从而提升基因功能预测的准确性。其意义在于为计算生物学提供一种可复现的基准,推动自噬相关疾病(如神经退行性疾病、癌症)的基因发现。影响体现在加速了从序列到表型的推理过程,减少了对大规模湿实验的依赖,为精准医学中的靶点识别奠定数据基础。
衍生相关工作
该数据集衍生了若干经典工作,包括基于Qwen3-4B模型的自噬蛋白序列生成与验证框架,以及结合top_k_progression策略的渐进式微调方法。相关研究还开发了多任务学习模型,同时处理自噬基因的编码与功能分类,并引入信任阈值(trust_t1.25)和生成组数(g7)等超参数优化训练稳定性。此外,衍生工作对比了不同基座模型(如GPT与Qwen系列)在该数据集上的收敛效率,揭示了模型规模与数据量之间的权衡关系,促进了面向小样本生物学任务的轻量化模型设计。
以上内容由遇见数据集搜集并总结生成



