stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g8_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3397947 num_examples: 142 download_size: 842166 dataset_size: 3397947 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
自噬编码数据集(autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g8_run1)基于高级语言模型Qwen3-4B在特定超参数配置下生成,采用低学习率0.0001与信任温度系数1.25进行参数微调,通过8个梯度累积步骤优化训练过程。数据集包含142个训练样本,每个样本涵盖任务标识、函数入口点、提示语、补全结果、Top-K递进信息及测试用例六项特征,以结构化JSON格式存储,构建逻辑强调代码补全任务的渐进式推理能力。
特点
该数据集的核心特质在于其精炼的样本规模与多维信息融合。142个实例虽数量有限,但每项均配备提示-补全对及Top-K递进信息,可支持对模型推理链路的细粒度分析。数据集专为代码生成与渐进式推理场景设计,通过信任温度调节与梯度累积策略平衡生成质量与多样性,适合用于评估小模型在代码补全任务中的性能边界。
使用方法
数据集以HuggingFace标准格式发布,包含单一训练分割(train),用户可通过datasets库直接加载默认配置。使用时建议将提示与补全字段配对作为输入输出,可结合Top-K递进信息研究模型的分步推理行为。测试字段提供了验证补全正确性的基准,适合用于微调代码生成模型或评估渐进式推理算法的有效性。
背景与挑战
背景概述
在大型语言模型(LLMs)的微调与推理优化领域,如何高效利用合成数据提升模型在特定任务上的表现成为研究热点。该数据集由AutophagyCode团队于2025年构建,核心研究问题是探索基于Qwen3-4B的代码生成模型在低学习率(0.0001)与强信任温度(1.25)设置下的微调效果,共包含142个训练样本,聚焦于任务识别、代码入口点与补全等结构化编程任务。该数据集通过迭代式top-k进展策略生成合成训练数据,旨在缓解小样本场景下模型泛化能力不足的困境,为开源社区在代码智能与轻量级模型微调领域提供了可复现的基准参考。
当前挑战
该数据集所解决的领域挑战在于代码生成模型在数据稀缺条件下的过拟合与泛化失衡问题,传统监督学习依赖海量标注数据,而现实中的特定编程任务(如私有API调用或领域特定语言)往往样本量极低。构建过程中面临的主要挑战包括:如何通过top-k进展策略从单任务示例中衍生出高质量合成数据,同时避免噪声累积导致模型崩溃;低学习率与强信任温度的超参数组合需在探索性与稳定性间取得平衡,以防早期训练陷入局部最优或灾难性遗忘。此外,仅142例的极小规模数据集对评估指标的方差控制提出了严格要求,需设计鲁棒的验证方案以区分模型能力的真实提升与随机波动。
常用场景
经典使用场景
在代码生成与智能编程领域,数据集被视为评估大语言模型代码生成能力的核心基准之一。该数据集主要设计用于代码补全与生成任务的微调与评估,特别关注模型在给定函数签名、输入输出示例及描述性提示下,生成正确且鲁棒的代码实现。其经典使用场景是构建基于transformer架构的代码生成模型,例如用于自动化编程竞赛题解、函数级代码生成,以及验证模型在复杂逻辑推理任务中的表现。
解决学术问题
该数据集致力于解决代码生成领域长期存在的泛化性与鲁棒性挑战,尤其是在多步推理与不确定条件下代码构建的难题。它帮助研究者量化模型对高层次任务意图的理解能力,以及将自然语言描述映射为可执行程序的能力。通过提供包含top_k_progression与completion字段的结构化数据,数据集推动了代码生成模型后训练过程中对逐步推理过程的探索,为提升模型在复杂编程任务上的思维链能力贡献了重要实验支撑。
衍生相关工作
该数据集衍生了多项经典研究工作,主要集中在代码生成模型的微调策略优化、指令微调框架设计以及推理链增强方法上。研究者基于该数据集探索了使用top_k_progression作为中间监督信号来提升模型逐步推理的能力,推动了代码生成中思维链与树搜索技术的结合。相关工作还包括对比学习在代码生成中的应用、错误修正策略的后训练,以及将代码生成与自然语言理解任务进行统一建模的跨模态学习框架。
以上内容由遇见数据集搜集并总结生成



