stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g5_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5820731 num_examples: 142 download_size: 1384385 dataset_size: 5820731 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集以Qwen3-4B模型为基座,在代码生成任务中通过自噬码(AutophagyCode)机制构建。其构建流程包括:基于任务标识(task_id)和函数入口(entry_point)生成提示(prompt),进而由模型输出补全代码(completion),并记录生成过程中的top-k渐进演化轨迹(top_k_progression)。数据集包含142个训练样本,每个样本均附带标准测试用例(test)以验证代码正确性,整体规模轻量但结构化完整。
特点
数据集的核心特色在于融合了自噬码机制,专注于代码生成任务中的渐进式优化过程。每条数据不仅包含标准的代码补全结果,还保留了模型在生成过程中top-k候选方案的演变历史,为研究模型推理策略和代码生成质量提供了细粒度观察窗口。此外,数据集高度结构化,字段设计覆盖从输入提示到最终测试验证的完整链条,便于进行代码智能的归因分析与教学式微调。
使用方法
该数据集适用于代码生成的模型微调与评估任务。使用者可直接加载HuggingFace格式的默认配置,以'prompt'作为输入、'completion'作为目标输出进行监督学习。对于需要分析生成过程的场景,可通过'top_k_progression'字段追踪模型决策路径。同时,'test'字段提供预置测试用例,便于在训练后直接执行代码正确性验证,形成闭环评估。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g5_run1,由研究团队构建,旨在探索大语言模型在代码生成任务中的微调与评估。数据集创建时间隐含于命名细节中,核心研究问题聚焦于如何通过小样本(142个训练样例)和特定超参数配置(如学习率0.0001、温度1.1)提升模型对复杂编程问题的解决能力。其影响力主要体现在为大语言模型在代码领域的可信微调提供标准化基准,尤其关注模型在有限数据下的泛化与稳定性,为后续研究减少对大规模标注数据的依赖提供了实证参考。
当前挑战
该数据集所解决的领域挑战为代码生成任务中模型对精确保留语法结构、逻辑正确性及多样化解题路径的适应能力不足,尤其是在小样本场景下如何避免过拟合与灾难性遗忘。构建过程中面临的挑战包括:从海量编程问题中筛选出能有效区分模型能力的142个任务,保证任务覆盖常见算法与边界情况;设计合理的top-k progression机制以平衡探索与利用,同时确保test split的评估真实性;以及在高学习率和低训练量下维持数据质量,避免因超参数敏感而引入噪声或偏差。
常用场景
经典使用场景
在代码生成与自动补全领域,该数据集凭借其精心设计的任务结构与高质量问答对,成为微调大型语言模型以完成算法竞赛级别编程任务的经典资源。研究者常利用其包含的task_id、entry_point、prompt与completion字段,训练模型从自然语言描述中精准生成函数实现,尤其适用于需要严格遵循问题规范、处理边界条件与运行测试用例的场景,被视为评估和提升模型在结构化编程任务上表现的重要基准。
解决学术问题
该数据集有效回应了通用语言模型在复杂编程任务中逻辑推理能力不足的学术挑战。通过提供142个经过筛选和标注的编程问题及其正确求解示例,它使研究者能够深入探索模型对问题分解、算法选择与代码正确性验证的内在机制,进而推动关于少样本学习、链式推理以及表征对齐等前沿议题的研究,为构建更可靠、更可解释的代码智能体奠定了坚实的实验基础。
衍生相关工作
依托该数据集,学术界已衍生出一系列富有影响力的工作。研究者基于其任务格式,提出了增强型提示工程策略与对比学习框架,以提升模型对代码语义的深度理解。另一些工作则聚焦于探索模型在不同编程语言间的迁移能力,或结合强化学习算法对模型生成的代码进行迭代优化。这些衍生研究不仅拓展了原数据集的学术价值,也为代码生成领域的方法论创新提供了持续动力。
以上内容由遇见数据集搜集并总结生成



