stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g7_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5374068 num_examples: 142 download_size: 1336799 dataset_size: 5374068 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集源自对Qwen3-4B模型在特定超参数配置下的微调结果进行结构化采集。构建过程中,以自噬码(autophagycode)领域任务为背景,固定学习率为0.0001、信任阈值1.1及生成轮次7,并选取前142个实例作为训练样本。每个样本包含任务标识、入口函数、提示文本、补全内容、top-k递进序列及测试用例,形成完整的代码生成与验证闭环。
特点
数据集兼具代码生成与质量验证的双重特性。其特色在于引入了'top_k_progression'字段,能够记录模型逐步推理或候选生成的递进过程,为分析代码补全的演化路径提供结构化素材。同时,每项任务均配备'entry_point'与'test'字段,支持自动化验证补全结果的正确性,从而服务于代码生成模型的鲁棒性评估与迭代优化。
使用方法
该数据集以HuggingFace标准格式存储,包含单一训练分片,共计142条样本。用户可通过加载'default'配置直接读取train分片的数据,利用'prompt'字段输入待补全的代码上下文,并借助'completion'字段作为目标输出进行监督学习。同时,可基于'test'字段开展零样本或小样本场景下的模型性能测试,验证生成代码的功能正确性。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g7_run2,创建于近期,由研究团队基于Qwen3-4B模型在代码生成任务中进行微调实验时构建。数据集聚焦于代码自动补全与问题求解领域,包含142个训练样本,每个样本涵盖任务标识、入口点、提示、补全结果、Top-K进展及测试信息。其核心研究问题在于探索如何通过少量高质量示例,提升模型在特定编程任务上的生成准确性与鲁棒性,尤其关注模型对复杂逻辑的信任度与渐进式推理能力。该数据集为代码智能领域的微调策略提供了实证基础,对理解小样本学习与大模型适应性具有推动作用。
当前挑战
该数据集所解决的领域挑战在于代码自动补全任务中模型对上下文语义的深度理解与精确生成,尤其面对长序列、多逻辑分支场景时,模型易出现泛化不足或分歧。构建过程中的挑战包括:样本数量仅142例,需确保每个示例覆盖关键变异点以维持代表性;同时,需平衡提示与补全之间的逻辑一致性,避免引入噪声。此外,Top-K进展的设计要求标注数据能够反映模型逐步推理路径,对人工验证与自动校验技术要求较高。数据集的规模与多样性限制也对其在跨任务迁移中的普适性构成考验。
常用场景
经典使用场景
该数据集为自噬相关代码生成领域提供了高质量的训练样本,每个样本包含任务标识符、函数入口点、提示词、补全代码、Top-K演化过程及测试用例。其经典使用场景是训练大型语言模型在生物信息学背景下进行函数级代码生成,尤其聚焦于自噬机制分析中的专用代码撰写,帮助模型从少量任务实例中习得特定领域的编程范式与逻辑结构。
解决学术问题
在计算生物学与自噬研究的交叉领域,现有编程任务训练数据往往缺乏领域特异性与任务粒度。该数据集通过精心设计的142个训练样本,精准解决了自噬相关代码自动化生成中数据稀缺与语义鸿沟的学术难题。其意义在于为面向生物信息学的小样本代码生成方法提供可复现的基准,推动领域适配语言模型在有限标注资源下实现高效迁移,从而加速自噬机制的计算解析与实验验证。
衍生相关工作
基于该数据集已衍生出多个相关方向的重要工作。一方面,它推动了面向少样本代码生成的提示优化技术研究,探索如何利用Top-K演化轨迹提升模型生成质量。另一方面,后续研究将其作为基准,比较不同规模基座模型(如Qwen系列)在生物领域代码生成上的微调效果,并催生了面向自噬代码检索与验证的专用评估工具,形成从数据构建到模型评测的完整研究链条。
以上内容由遇见数据集搜集并总结生成



