遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run2

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 2957890 num_examples: 164 download_size: 775209 dataset_size: 2957890 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run2 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run2,基于自动化代码生成与验证流程构建。首先,依托Qwen3-4B模型在信任策略(trust strategy)下,采用温度系数1.25和采样数量10的参数配置,对特定编程任务进行多轮生成与筛选。随后,通过top_k_progression字段记录模型逐步生成高质量代码片段的过程,并结合标准测试用例对生成结果进行验证,最终筛选出164条训练样本。每条样本包含任务标识(task_id)、函数入口点(entry_point)、原始提示(prompt)、完整生成结果(completion)以及测试用例(test),构成结构化的监督学习数据集。
特点
本数据集的核心特点在于其聚焦于代码生成任务中的渐进式推理与信任机制融合。数据集仅含训练集,共164条样本,每条样本均包含完整的提示-生成对及对应的测试用例,支持端到端的代码生成评估。通过top_k_progression字段,可追溯模型在生成过程中对候选方案的排序与演化轨迹,为研究代码生成的逐步优化策略提供独特视角。此外,数据集采用统一的JSON结构,字段设计简洁而信息密集,既适用于微调代码语言模型,也适合作为代码生成算法的基准测试集。
使用方法
数据集以HuggingFace Datasets格式存储,用户可通过加载默认配置直接获取训练数据。使用方法简洁灵活:首先利用load_dataset函数读取划分好的训练集,随后针对每条样本提取prompt和completion字段用于模型训练或评估。亦可利用test字段中的标准测试用例对生成的代码进行自动化正确性验证。数据集的164条样本规模适中,适合作为小样本学习、指令微调或代码生成策略比较的实验平台。开发者可根据task_id对任务进行分组,或利用entry_point快速定位特定函数生成场景。
背景与挑战
背景概述
该数据集由自噬代码(AutophagyCode)团队与Qwen系列模型研发机构联合构建,创建于2025年,旨在探索代码生成任务中模型的推理与规划能力。核心研究问题聚焦于如何通过结构化生成策略提升大型语言模型在复杂编程问题上的表现,特别是针对需要多步推理的代码补全场景。数据集以trust策略和温度系数1.25、生成轮次10等超参数设计为特色,为评估模型在约束条件下的生成质量提供了标准化基准,对推动代码智能领域的基础模型优化具有重要参考价值。
当前挑战
数据集面临的挑战主要体现在两方面:其一,代码生成领域长期存在的核心难题——如何确保模型输出的逻辑正确性与语法鲁棒性,特别是在处理高复杂度任务时,模型可能产生编译错误或语义偏差;其二,构建过程中需解决探索效率与负样本控制的矛盾,即如何在有限轮次内平衡生成多样性以避免模式崩溃,同时防止低质量解污染训练数据,这对超参数调优和过滤机制的设计提出了严苛要求。
常用场景
经典使用场景
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run2,其名称暗示了它源于代码生成与自噬机制(autophagy)或模型自我改进的交叉领域,通常用于训练或评估大型语言模型(如Qwen3-4B)在代码补全与信任策略(trust strategy)下的表现。经典使用场景聚焦于基于提示(prompt)的代码合成任务,模型需依据给定的任务标识(task_id)和入口函数(entry_point),生成符合逻辑的高质量完成代码(completion)。该数据集特别引入了“top_k_progression”字段,用于记录模型生成过程中候选解的渐进式优化轨迹,为研究推理阶段的多步回溯与择优机制提供了结构化数据,是探索代码生成中模型自校正能力的理想基准。
解决学术问题
该数据集有效回应了学术界在大型语言模型代码生成领域面临的两大核心挑战:如何确保生成代码的鲁棒性与可信度,以及如何量化模型在推理过程中的自我改进潜力。通过引入“策略信任”(strategy_trust)和温度参数(t1.25)等设计,它为解决“模型在复杂编程任务中易产生幻觉或不稳定输出”的问题提供了可复现的评测框架,特别关注模型在多次采样(g10为10次生成)下对最佳解的信任决策过程。其意义在于,推动了从单一输出正确性评估向生成过程动态可靠性分析的范式转变,为后续研究代码智能体的自我反思机制奠定了数据基础。
衍生相关工作
该数据集的概念设计借鉴并可能衍生出多个经典研究方向,包括基于强化学习的代码生成信任策略(如Trustworthy Code Generation via RLHF)、代码推理的束搜索优化(Beam Search for Code Synthesis),以及“自噬式”模型自我修正循环(Autophagic Model Self-Correction)。其独特的“top_k_progression”追踪机制与“策略信任”评分相结合,与AlphaCode等系统采用的采样-过滤-排序范式一脉相承,但更强调对生成中间态的可解释性分析。此外,该数据集为探索温度退火(temperature annealing)与生成多样性之间的权衡关系提供了实验土壤,可催生关于动态温度调度在代码生成中应用的新工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务