stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4429814 num_examples: 164 download_size: 1198018 dataset_size: 4429814 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
本数据集基于自演化学习范式构建,以Qwen3-4B为基座模型,采用信任策略(trust)与温度系数1.25、生成轮次4的配置,对特定编程任务进行迭代式数据生成。数据来源于Mercury基准测试集合,通过提取任务标识、入口函数、提示文本及测试用例等关键字段,结合模型完成序列与top-k渐进输出,形成覆盖164个训练样本的结构化语料库。
特点
数据集以代码生成任务为核心,包含任务标识、提示文本、完整补全结果及top-k渐进生成路径等多元维度,尤其通过top_k_progression字段记录模型从初始到最终输出的推理演进过程。这种多粒度结构有助于分析模型在代码生成中的思维链与修正模式,为研究自洽性提升策略提供细粒度观测窗口。
使用方法
数据集以HuggingFace Datasets格式存储,支持通过load_dataset函数直接加载默认配置下的训练分片。用户可基于task_id与entry_point字段进行任务关联分析,利用prompt与completion字段构建监督学习任务,或借助top_k_progression字段开展模型渐进式生成行为的研究与评估。
背景与挑战
背景概述
随着大型语言模型在代码生成任务中的广泛应用,如何评估和提升模型对复杂编程问题的求解能力成为研究热点。该数据集由AutophagyCode团队于2024年创建,依托Qwen3-4B模型,采用信任策略(trust strategy)结合温度系数1.25与生成轮次4的采样方法,专注于代码生成过程中的逐步推演与最终完成。数据集涵盖164个训练样本,每个样本包含任务标识、函数入口、提示、完成代码、最优进展轨迹及测试用例,旨在探究模型在程序合成中的渐进式推理能力。其研究核心在于通过结构化的训练数据,推动代码生成模型从单步输出向多步可靠推理的范式转变,为人工智能辅助编程领域提供了重要的基准资源。
当前挑战
当前数据集面临多重挑战。在领域问题层面,如何促使模型在代码生成中实现可靠的逐步推理而非简单模式匹配,仍是核心难题,尤其面对需要多步逻辑推导的复杂算法任务时,模型易产生语义偏差或错误中间状态。在构建过程中,数据集仅包含164个样本,规模较小可能限制模型泛化能力;同时,采用特定温度系数与策略生成的训练数据,其多样性受限于预设参数空间,难以覆盖真实编程场景中的异常模式。此外,最优进展轨迹的标注依赖人工或自动验证,存在噪声引入风险,且测试用例的完备性直接影响评估结果的可靠性,这些因素共同构成了数据集构建与应用的显著障碍。
常用场景
经典使用场景
该数据集专为代码生成与自动补全任务而设计,聚焦于提升大型语言模型在复杂编程场景中的推理与生成能力。其经典使用场景包括从自然语言描述的任务提示(prompt)出发,生成对应的功能性代码片段,并利用复合补全(completion)与逐步优化机制(top_k_progression)来迭代提升代码质量。数据集中的每条样本均包含任务标识、入口函数、测试用例等结构化信息,特别适合用于训练模型在给定部分代码或注释的条件下,预测并完成后续的代码逻辑,从而在代码智能领域形成对传统静态分析方法的有效补充。
实际应用
在实际工程与产品生态中,该数据集可直接用于强化交互式开发环境(IDE)中的智能代码补全与实时建议能力。基于此数据集训练的模型能够根据开发者输入的半成品代码或功能描述,准确预测后续语法结构乃至完整函数体,显著降低手动编码的认知负荷与时间成本。此外,在自动化测试生成、代码审查辅助以及领域特定脚本的开发场景中,该数据集提供的多步生成与自校验机制也有助于构建更贴合实际编码流程的辅助工具,提升软件开发的整体生产效率与代码质量。
衍生相关工作
围绕该数据集衍生了一系列探索代码生成策略与模型信任机制的代表性工作。研究人员基于其结构化字段设计出多轮修正的生成框架,将top_k_progression信息融入强化学习训练以优化代码输出路径。另有工作聚焦于利用数据集中的测试用例(test)字段,构建自动代码验证与错误回溯系统,形成覆盖生成与测试闭环的智能编程范式。此外,部分衍生研究将该数据集与少样本学习相结合,探索在数据稀缺情况下如何通过数据增强与信任评分机制维持模型在特定编程任务上的生成稳定性,推动了代码智能领域方法论的发展。
以上内容由遇见数据集搜集并总结生成



