stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g5_run1
收藏数据链接:
官方服务:
资源简介:
该数据集是一个编程或代码生成相关的训练集,包含142个示例,每个示例具有任务ID、入口点、提示文本、完成内容、top_k进展和测试字段,用于支持模型在代码任务上的训练和评估。
This dataset is a training set related to programming or code generation, containing 142 examples, each with fields such as task_id, entry_point, prompt, completion, top_k_progression, and test, designed to support model training and evaluation on code tasks.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
本数据集名为autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g5_run1,源自对代码生成任务的深度优化探索。构建过程中,以Qwen3-8B模型为基础,采用学习率为0.0001的微调策略,结合温度参数1.25与束搜索宽度5(g5),在“trust”机制下对模型输出进行筛选与增强。数据集共包含142个训练样本,每个样本涵盖任务标识、入口函数、提示词、补全代码、Top-K迭代过程及测试用例六个字段,通过结构化的代码生成与验证流程,形成针对特定编程问题的精细化数据集合。
特点
该数据集的核心特点在于其高精度的代码补全与渐进式生成能力。每个样本不仅包含标准的代码提示与补全对,还记录了Top-K候选序列的迭代演变过程(top_k_progression),为研究模型在代码生成过程中的推理路径提供了可追溯的细节。同时,配套的测试用例(test)确保每一组代码补全的可执行性与正确性。数据集规模虽小(142例),但每个样本均经过温度系数与束搜索的联合调优,在有限数据量下实现了对代码生成质量的深度刻画。
使用方法
使用者可直接加载HuggingFace默认配置下的训练集(train),数据以Parquet格式存储于data/train-*路径下。通过task_id与entry_point字段可唯一标识每个编程任务及其入口函数,prompt与completion字段支持标准的监督微调训练。研究者可特别利用top_k_progression字段分析模型在束搜索中的候选代码演化模式,或借助test字段进行自动化评估。该数据集适用于代码生成模型的微调、推理路径分析及生成策略对比等研究场景。
背景与挑战
背景概述
该数据集由 autophagycode 团队于近期创建,核心基于 Qwen3-8B 模型在特定学习率(0.0001)与生成配置(trust 阈值1.25、top-k 渐进式采样5步)下生成的代码补全数据。数据集包含142个训练样本,聚焦于代码任务(task_id、entry_point)及其对应的 prompt-completion 对,旨在探索大语言模型在细粒度代码生成中的表现与优化路径。其研究背景源于代码智能领域对模型生成质量与可控性的追求,通过引入 top_k_progression 字段记录生成过程中候选 token 的演进,为分析模型决策过程提供了独特视角,有望推动代码合成任务中可解释性与鲁棒性研究的进展。
当前挑战
当前数据集面临的核心挑战在于规模有限(142例样本)可能制约模型的泛化能力与统计显著性,需在小样本场景下验证其对于代码生成任务的代表性。构建过程中,如何平衡高信任阈值(1.25)与生成多样性(top-k 渐进采样)之间的张力成为技术难点,过热参数设置易导致输出质量下降或模式坍塌。此外,缺乏独立测试集与跨领域任务验证,使得数据集在评估模型真实代码补全能力时面临偏差风险,后续需扩展样本量与任务覆盖度以提升其基准价值。
常用场景
经典使用场景
该数据集专为代码生成与编程推理任务设计,核心场景聚焦于通过自然语言描述自动合成功能性代码片段。其结构包含任务标识、入口函数、提示文本与补全内容,适用于评估大语言模型在受限编程问题上的补全能力。研究人员常将其作为基准,测试模型在特定编程任务中的零样本或少样本泛化表现,例如从多步推理过程提取关键逻辑以生成正确代码。
衍生相关工作
该数据集支持衍生出针对代码补全的提示优化研究,例如探索如何通过top_k_progression字段中的逐步推理信息增强模型对复杂任务的分解能力。相关工作还包括基于其任务结构设计专用评估指标,以及结合test字段构建对抗性样本以测试模型对异常输入的鲁棒性。这些衍生方向共同促进了代码生成领域从单纯追求BLEU分数向更关注推理过程可解释性的转型。
数据集最近研究
最新研究方向
在当前大语言模型飞速演进的浪潮中,该数据集聚焦于代码生成任务的精细化微调与推理优化。通过将Qwen3-8B作为基座模型,结合自噬机制(autophagy)与信任令牌衰减策略(trust_t1.25)以及前k项渐进式生成(top_k_progression),研究者致力于突破传统监督微调在代码补全与多步推理中的瓶颈。该数据集的142个精心标注样本覆盖了从函数入口(entry_point)到完整测试用例的闭环,其背后折射出对模型自我纠错能力与长程依赖性建模的前沿探索。这一方向与近期涌现的“代码自进化”及“少样本推理泛化”等热点紧密呼应,为提升代码智能体的鲁棒性与可解释性提供了关键基准,对推动AI辅助软件工程领域迈向更可信、更自主的生成范式具有深远意义。
以上内容由遇见数据集搜集并总结生成



