stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 6017084 num_examples: 142 download_size: 1422991 dataset_size: 6017084 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run1,其构建过程深度融合了自动化代码合成与指令微调技术。基于Qwen3-4B基础模型,在特定学习率0.0001下,通过trust_t1.1与g3_run1参数配置,生成针对自噬相关基因D(autophagycode_D)的代码补全任务。数据集包含142个训练样本,每个样本由task_id唯一标识,entry_point定义函数入口,prompt提供问题描述,completion给出预期代码补全结果,top_k_progression记录多步推理过程,test字段用于最终验证。数据以parquet格式存储,合计约6MB,整体设计体现了小规模、高针对性的指令微调数据构建思路。
特点
该数据集的核心特点在于其高度结构化且聚焦于特定生物信息学代码补全场景。每条数据不仅包含标准的prompt-completion对,还创新地引入了top_k_progression字段,可记录模型在推理过程中逐步选择最优代码片段的路径,形成可追溯的渐进式推理轨迹。此外,entry_point字段明确了待补全函数的具体命名与接口,使得数据集天然适用于函数级别的代码生成评估。142个样本虽数量精炼,但每个样本均附带独立测试用例(test字段),支持精确的功能性验证,避免了仅依赖表面文本匹配的局限性。这种设计兼顾了训练效率与评估准确性,尤其适合探索少样本场景下大语言模型的代码推理能力。
使用方法
该数据集的使用方式遵循标准的指令微调与代码生成评估流程。训练阶段,可将prompt作为输入,completion作为目标输出,加载至HuggingFace Transformers框架中,配合Qwen3-4B模型与指定的学习率配置进行微调。评估时,利用test字段中的测试用例,针对模型生成的代码执行功能性验证,同时可结合top_k_progression字段分析推理路径的合理性。推荐使用HuggingFace的load_dataset函数直接加载train切分,数据已按parquet格式存储,兼容主流深度学习流水线。研究者也可将entry_point与prompt组合后输入模型,对比其输出与ground truth completion的差异,从而实现模型代码生成能力的量化评估。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,旨在探索针对Qwen3-4B模型在特定任务上的微调与推理优化。数据集包含142条训练样本,每条样本涵盖任务标识、入口函数、提示词、补全文本及测试用例等结构化字段,核心研究问题聚焦于如何通过有限的高质量数据增强小型语言模型在编程或代码生成任务中的表现。尽管规模较小,该数据集为轻量化模型的能力提升提供了新的实验基准,尤其对资源受限场景下的大模型部署具有潜在指导意义,推动了领域内对数据效率与模型性能之间平衡的深入探讨。
当前挑战
当前数据集面临的主要挑战包括领域问题与构建过程两方面。在领域层面,其旨在解决的代码生成任务仍受限于模型对复杂逻辑与长程依赖关系的理解能力,小数据量下模型易陷入过拟合或泛化不足的困境。构建过程中,如何从纷繁的代码语料中筛选出高代表性、低冗余的142条样本,并确保其能有效激发4B参数模型的推理潜力,是一大难题;此外,样本中提示与补全的语义对齐、测试用例的完备性设计,以及避免数据偏见对模型输出鲁棒性的影响,均需持续优化与验证。
常用场景
经典使用场景
在代码生成与程序合成领域,该数据集聚焦于通过任务描述与函数签名自动生成完整函数体的经典场景。每条样本包含唯一的任务标识、待实现的函数入口点、自然语言提示及对应的补全代码,形成了从需求到实现的端到端映射。研究者可基于此训练模型学习理解语义约束并生成语法正确的代码片段,尤其适用于评估大语言模型在细粒度编程任务上的代码补全与逻辑推理能力。
衍生相关工作
基于此数据集,研究者衍生出若干典型工作方向:一是利用`task_id`与`entry_point`配对构建跨语言迁移学习的训练范式,探索多语言代码生成中的共享抽象;二是围绕`completion`字段开展对比学习研究,通过生成假设与测试用例的联合优化改进代码正确性;三是将`top_k_progression`引入强化学习流水线,设计渐进式奖励模型以解决代码生成长序列中的稀疏反馈问题,这些工作共同丰富了程序合成与自动化调试的理论体系。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成领域的自噬式推理与信任校准前沿,特别是针对小型语言模型在复杂编程任务中的多步推理能力优化。通过引入‘top_k_progression’字段追踪模型在生成过程中的逐步置信度演化,研究者得以探索模型如何自主修正错误分支并收敛至正确解法。此类方向与当前大语言模型在少样本、零样本场景下推理透明性与可解释性需求紧密相连,尤其呼应了业界对‘反思式编码’(reflective coding)与‘自我纠错’机制的强烈关注。autophagycode_D_mercury_Qwen3-4B的独特设计,为评估和增强轻量级模型在低资源环境下处理算法竞赛级问题的鲁棒性提供了关键基准,其背后的技术路径有望推动自动化代码生成在教育、辅助编程等领域的可靠落地。
以上内容由遇见数据集搜集并总结生成



