stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g4_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5354909 num_examples: 164 download_size: 701685 dataset_size: 5354909 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集面向自动化代码生成与评估任务,采用策略引导的生成机制构建。以Qwen3-8B模型为基础,在温度参数0.75、分组数4、运行序号1的配置下,通过信任策略生成候选程序,并借助自动化测试用例对每轮生成结果进行筛选与验证。最终形成的训练集包含164个样本,每个样本均配有任务标识、入口函数、自然语言提示、模型补全代码、多轮候选序列及测试用例,为代码生成研究提供了结构化的监督信号。
特点
数据集聚焦于代码补全与程序合成的交叉领域,突出多轮候选生成与执行验证的耦合特性。其核心特色在于top_k_progression字段记录了模型采样过程中候选方案随生成轮次的演化轨迹,配合test字段提供的可执行测试用例,能够支持对生成代码正确性与鲁棒性的有监督评估。数据规模精简,结构清晰,适合用于轻量级模型微调、解码策略对比以及代码生成过程的可解释性分析,在自动化软件工程研究中具备明确的实验价值。
使用方法
使用该数据集时,可将其作为监督微调或评估基准加载,通过HuggingFace datasets库直接读取训练集。研究者可依据prompt与completion构造输入输出对,用于代码生成模型的训练或推断;利用test字段执行单元测试以验证生成代码的功能正确性;通过top_k_progression回溯多轮采样路径,分析解码策略对代码质量的影响。task_id与entry_point字段便于跨样本对齐与结果聚合,适合在代码智能、程序合成及自动评测等场景中开展系统性实验。
背景与挑战
背景概述
在代码生成与程序合成领域,大规模语言模型对代码逻辑的建模能力已成为衡量其智能水平的关键标尺。该数据集由匿名研究团队构建,聚焦于自噬代码(autophagy code)这一特殊范畴,即模型在训练过程中对自身生成代码进行迭代优化与再训练的闭环策略。数据集收录164个训练样本,涵盖任务标识、入口函数、提示、补全及测试用例等字段,旨在探索信任策略下模型自我改进的可行性。其核心研究问题在于:当模型以Qwen3-8B为基座、在温度0.75、组规模4的设定下反复消化自身输出时,代码生成质量能否获得稳定提升,抑或陷入退化循环。该工作为代码自训练与数据筛选机制提供了实证基础。
当前挑战
该数据集所应对的领域问题在于代码生成模型对训练数据分布的敏感性——模型若不加甄别地吸收自身产物,极易引发模式坍塌与错误累积。构建过程中的挑战同样显著:如何设计信任策略以区分可靠自产代码与低质噪声,如何在温度采样与组规模之间取得平衡以维持输出多样性,以及如何借助测试用例字段验证生成代码的功能正确性。此外,自噬训练闭环中语义漂移的量化评估、任务入口点的标准化定义、以及小样本条件下过拟合风险的抑制,均构成该数据集在方法学层面的核心难点。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集凭借其独特的任务标识、入口点、提示、补全、top-k演进轨迹与测试用例六元组结构,构筑了评估和提升大语言模型代码生成能力的经典实验场。研究者常将其用于监督微调与策略优化实验,在函数级代码补全任务中考察模型对复杂逻辑与接口规约的遵循程度。
衍生相关工作
围绕该数据集,后续研究衍生出基于策略信任度的强化学习代码生成方法、多轮迭代的自我修正框架以及面向执行反馈的课程学习策略。这些工作进一步探索了top-k演进信号在训练目标中的整合方式,并推动了代码大模型在复杂编程任务上的泛化能力边界。
数据集最近研究
最新研究方向
针对代码生成模型的信任策略与自回归优化研究,该数据集聚焦于利用Qwen3-8B模型在自噬代码任务中,通过温度系数0.75与分组大小为4的采样策略,探索模型输出与测试用例之间的可信度对齐。前沿研究关注于如何借助top_k_progression等动态解码信息,提升代码补全的鲁棒性与可解释性,尤其在大规模代码生成基准上,该方向关联到自动化编程与AI安全的热点议题。其意义在于为代码大模型的可靠性评估提供细粒度训练信号,推动可信AI在软件工程中的落地。
以上内容由遇见数据集搜集并总结生成



