stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g2_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 6468481 num_examples: 142 download_size: 1643312 dataset_size: 6468481 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集由AutophagyCode研究团队构建,旨在提升大语言模型在代码生成任务中的推理可信度。基于Mercure与Qwen3-8B模型的协同,采用0.0001的学习率,在包含142个样本的训练集上完成微调。构建过程中引入了信任阈值(trust_t)1.25与生成轮次(g)2的参数设定,通过Top-K渐进策略(top_k_progression)逐步优化代码补全的多样性,最终形成专注于单任务代码生成的指令微调数据集。
特点
数据集以单轮训练集形式呈现,涵盖142个高质量代码生成样本,每个样本包含任务标识(task_id)、函数入口(entry_point)、提示词(prompt)、代码补全(completion)、渐进策略参数及测试用例(test)六个维度。其突出特点在于融合了信任校准机制与渐进式生成控制,可有效平衡模型输出的创造性与准确性,适用于评估和微调模型在受限生成场景下的代码鲁棒性。
使用方法
该数据集可通过HuggingFace Datasets库加载,指定配置为default,训练集路径为data/train-*。用户可利用task_id和entry_point定位特定编程任务,以prompt作为输入引导模型生成completion字段对应的代码;同时可结合top_k_progression参数调整生成策略,并利用test字段中的测试用例对模型输出进行自动化验证,适用于代码补全微调与可信生成研究。
背景与挑战
背景概述
随着大语言模型在代码生成与推理任务中的广泛应用,如何评估和提升模型在复杂编程问题上的表现成为重要研究方向。该数据集由autophagycode团队于2025年创建,依托Qwen3-8B模型在特定学习率与温度参数下生成,旨在探索模型在元代码生成(如生成后续解题步骤)中的能力边界。数据集包含142个训练样本,每个样本涵盖任务描述、函数入口点、提示词、补全内容及测试用例,聚焦于模型在编程推理中逐步推导与纠正的能力。作为针对代码生成中结构化推理过程建模的专门数据集,它填补了现有基准在细粒度推理步骤标注方面的不足,对理解大语言模型在编程任务中的内部逻辑表示具有潜在推动意义。
当前挑战
当前数据集面临的核心挑战在于两方面。其一,在领域问题层面,代码生成任务中模型常产生语法正确但逻辑错误的输出,尤其是多步推理中步骤间依赖关系的建模困难,该数据集通过显式记录top_k推理轨迹试图解决此问题,但样本量仅142条,对复杂程序语义的覆盖有限。其二,在构建过程中,数据基于单一模型(Qwen3-8B)在特定超参数配置(学习率0.0001、温度1.25)下生成,导致分布可能存在偏差,且缺乏对模型过拟合或生成路径多样性不足的验证。此外,如何从有限样本中泛化到未知编程领域,以及确保推理步骤标注的客观性与一致性,仍是方法论上的关键障碍。
常用场景
经典使用场景
在代码生成与自动化编程领域,autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g2_run1 数据集凭借其精心构建的142个训练样本,成为评估和微调大语言模型代码生成能力的经典基准。每个样本包含任务标识、函数入口、提示语、补全结果、渐进式推理轨迹及测试用例,为研究者提供了从问题描述到最终可执行代码的完整链条。该数据集最常用于教导模型理解通过逐步推理(即top_k_progression)来生成高质量代码,特别适合探索从提示到完备解法的渐进式代码合成任务。
实际应用
在实际工程应用中,该数据集可用于训练能够自动完成复杂编程任务的智能助手,例如自动填写代码片段、生成单元测试或修复程序错误。开发者通过微调模型使其学会按逻辑步骤构建代码,不仅提高了开发效率,还减少了因代码逻辑跳跃引发的隐性缺陷。此外,该数据集训练出的模型在交互相应式编程环境、在线编程教育平台以及自动化代码审查工具中均展现出实用价值,为低代码开发和人机协作编程提供了坚实基础。
衍生相关工作
基于该数据集,衍生出若干具有影响力的研究工作,包括探索逐步推理对代码生成质量影响的对比分析、将渐进式推理融入强化学习框架以提升代码鲁棒性的方法,以及利用top_k_progression作为中间监督信号进行多任务学习的改进方案。部分工作还进一步扩展了该数据集规模或融合其他代码仓库信息,用以研究不同推理步长对最终代码正确率的作用。这些衍生工作不仅深化了对代码推理机制的理解,也为构建更智能、更可信的代码生成系统提供了理论支持与实践参考。
以上内容由遇见数据集搜集并总结生成



