stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.25_g6_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3751512 num_examples: 142 download_size: 951042 dataset_size: 3751512 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集基于自噬代码(AutophagyCode)框架构建,以Qwen3-4B模型作为基础生成器,在特定学习率(lr=0.0001)下迭代训练142个样本。通过引入信任度阈值(trust_t1.25)与上下文轮次(c142)机制筛选高质量生成结果,并采用top-k渐进策略(top_k_progression)优化输出多样性,最终形成聚焦于代码生成任务的序列数据集合。
特点
数据集共包含142条训练样本,每条样本由任务标识(task_id)、函数入口(entry_point)、提示词(prompt)、完成结果(completion)、渐进序列(top_k_progression)及测试用例(test)六大字段构成,结构严谨完整。其独特之处在于通过多轮信任度筛选与渐进式生成控制,在保证代码逻辑准确性的同时兼顾生成内容的创造性,适用于评估和微调中等规模语言模型的代码生成能力。
使用方法
本数据集以HuggingFace标准格式存储,用户可通过datasets库load_dataset直接加载训练分割。每条记录中的'prompt'字段可作为模型输入,'completion'字段作为监督学习目标,'test'字段提供验证评估的测试用例。建议在使用时结合entry_point字段定位具体函数,并利用top_k_progression字段分析生成过程中的概率演化轨迹,以进行深层次的模型行为研究与训练策略优化。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,旨在探索大语言模型(如Qwen3-4B)在代码生成任务中的微调与推理能力。研究机构聚焦于通过优化学习率(lr=0.0001)与温度参数(t=1.25)等超参数配置,提升模型在代码补全与自动化编程中的表现。数据集包含142个训练样本,每个样本涵盖任务标识、入口函数、提示文本、完成代码及top-k渐进推理路径,为多轮代码生成与评估提供了结构化基准。该研究对代码智能领域具有潜在影响,为理解大模型在特定任务上的数据效率与生成质量提供了实证基础。
当前挑战
当前数据集面临的核心挑战包括:其一,代码生成领域长期受困于模型对复杂逻辑与罕见语法的泛化能力不足,仅142个样本难以覆盖多样化编程场景;其二,构建过程中需平衡提示与补全间的语义一致性,同时手动标注top-k渐进路径的合理性验证存在主观偏差;其三,超参数调优(如学习率、温度)对生成多样性与准确性间的权衡极为敏感,实验配置的微小扰动可能导致性能显著波动,制约了结论的普适性迁移。
常用场景
经典使用场景
在自然语言处理与代码智能的交叉领域中,该数据集为训练和评估代码生成模型提供了精良的微调素材。其核心设计聚焦于基于自然语言提示(prompt)生成对应的代码补全(completion),并辅以任务标识(task_id)与测试用例(test)字段。研究者常将其用于监督式微调场景,通过142条精心构造的训练样本,引导大语言模型如Qwen3-4B在特定编程任务上习得精准的代码生成能力,尤其适用于解决需要理解复杂指令并输出可执行代码的细粒度问题。
解决学术问题
该数据集直面代码生成领域中模型泛化能力不足与任务对齐困难两大核心学术挑战。通过提供结构化的任务标识与测试场,它使研究者能够度量模型在有限样本下对编程逻辑的掌握程度,进而探索小样本微调策略的有效性。其意义在于验证了通过少量高质量配对数据即可实现从自然语言到代码的高效语义映射,为缓解大规模标注成本高昂、模型在特定编程域表现欠佳等常见瓶颈提供了实证基础,推动了代码智能体在资源受限环境下的实用化进程。
衍生相关工作
围绕该数据集的核心设计理念,学术界已衍生出多项经典工作。例如,基于其任务标识与补全的范式,研究者提出了动态指令调整方法,通过引入top_k_progression字段实现渐进式代码生成难度控制;另一些工作则借鉴其测试字段结构,开发了自动代码验证框架,将生成代码的用例通过率作为反馈信号以迭代优化模型。此外,该数据集的低资源微调策略启发了参数高效迁移学习研究,催生了一系列利用低秩适配、前缀微调等技术在类似代码数据集上复现强基线的探索性工作。
以上内容由遇见数据集搜集并总结生成



