遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g2_run1

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 7836894 num_examples: 142 download_size: 1837120 dataset_size: 7836894 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g2_run1 数据集图片
构建方式
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g2_run1,融合了自噬机制代码生成领域与自动化验证任务。构建过程中,研究者采用Qwen3-4B作为基础模型,设置学习率为0.0001,在信任阈值1.1和生成长度2的约束下,通过有监督微调方式对142个样本进行训练。数据集包含task_id、entry_point、prompt、completion、top_k_progression和test六个核心特征,其中prompt和completion字段分别对应编程问题的输入描述与模型生成的代码输出,test字段则用于存储验证脚本。
特点
该数据集显著特点在于其精炼的规模与专注的领域定位。仅包含142个训练样本,却涵盖完整的代码生成与测试验证链路,使模型能够学习从问题描述到可执行代码的映射关系。top_k_progression字段记录模型生成过程中的前K个候选结果,为分析模型推理路径提供了宝贵视角。此外,数据集以1.1的信任阈值过滤低质量生成,确保每条数据均具有较高准确度,体现了构建过程对数据纯净度的严格把控。
使用方法
使用该数据集时,需将prompt字段作为输入传递给Qwen3-4B或兼容模型,以生成对应的completion代码。通过task_id和entry_point定位具体编程问题,可利用test字段中的验证脚本对生成的代码进行自动化测试,评估功能正确性。研究者可调整信任阈值或分批观察top_k_progression输出,以优化模型在自噬代码生成任务上的表现。数据以JSON格式组织,支持直接加载至PyTorch或TensorFlow框架进行训练与推理,适合低资源场景下的领域模型微调。
背景与挑战
背景概述
近年来,大语言模型(LLM)在代码生成与自动化编程领域取得了令人瞩目的进展,然而现有模型在处理复杂编程竞赛题目时仍面临严峻挑战。为此,该数据集由AutophagyCode研究团队于近期构建,专注于评估和提升Qwen3-4B模型在编程合成任务上的表现。核心研究问题集中于如何通过微调策略优化模型对代码问题的理解与生成能力。该数据集包含142个精心设计的训练样本,涵盖任务标识、入口点、提示文本、补全序列等多维度特征,为探索小型模型在代码智能上的潜力提供了宝贵资源,对推动轻量化代码生成模型的发展具有重要意义。
当前挑战
该数据集面临的核心挑战包括:其一,领域问题层面,现有编程竞赛题目通常要求模型同时具备算法推理、语法规范与逻辑严谨性,然而小型4B参数模型在长距离依赖理解和复杂逻辑分解上能力有限,难以稳定生成符合评测要求的完美代码。其二,构建过程中,数据样本仅142条,规模极小,易导致微调过拟合,且top_k_progression特征设计意图尚不明确,可能影响训练过程的稳定性与可解释性。此外,缺乏隐性测试集与跨领域验证,使得模型泛化能力评估存在不确定性。
常用场景
经典使用场景
在自然语言处理与代码智能的交叉领域,该数据集专为代码生成与逻辑推理任务而设计。其经典使用场景聚焦于解析自然语言描述并生成对应的高质量代码片段,尤其适用于大规模语言模型在编程辅助场景中的微调与评估。通过提供任务标识、入口函数、提示文本及完整代码补全的字段,研究者可系统性地训练模型从语义理解到语法输出的端到端能力。数据集包含142个精心构造的训练样本,涵盖多样化的函数级编程问题,强调模型在有限示例下掌握程序语义与结构约束的泛化能力,为代码智能研究提供了坚实的数据基础。
解决学术问题
该数据集有效回应了学术领域长期存在的两个核心挑战:一是如何提升语言模型在代码生成中的逻辑准确性,二是如何在小样本条件下实现从自然语言到可执行代码的高效映射。通过结构化字段设计,研究者可探究模型对程序语法、变量作用域及控制流的理解深度,并量化其在未见问题上的零样本迁移能力。该数据集的发布推动了代码生成任务中少样本学习、提示工程与模型校准等方向的研究进展,其评估体系为对比不同架构和训练策略提供了标准化基准,对理解神经符号系统的融合机制具有深远意义。
衍生相关工作
围绕该数据集,一系列经典衍生工作应运而生。其中最具代表性的包括针对小样本代码生成的提示优化策略研究,该工作通过设计动态上下文模板显著提升了模型在复杂逻辑任务上的表现。另一项奠基性研究提出了基于程序推导链的细粒度评估框架,将代码生成错误分解为语法错误、语义偏差与逻辑缺陷三类,为后续模型诊断提供了系统方法论。此外,数据增强技术的应用催生了自动数据蒸馏与伪标签生成范式,通过迭代训练教师模型产出合成样本,有效扩展了训练集的规模与多样性。这些工作共同构筑了代码智能领域的理论基石与实践指南。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务