stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3483834 num_examples: 164 download_size: 940799 dataset_size: 3483834 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run2,是面向代码生成与推理任务构建的微调数据集。其构建基于Qwen3-4B模型,采用trust策略,温度参数设为1.25,生成轮次为6,旨在通过多次采样获取高质量的程序补全结果。数据集的每条样本包含任务标识、函数入口点、提示词、补全代码、top-k演进过程及测试用例,共计164个训练实例,以JSON格式存储于train分片中,便于模型进行监督式微调。
特点
该数据集的核心特点在于其精选的规模与结构设计。仅包含164个样本,均为经过策略筛选的高可信度代码补全实例,强调质量而非数量,适合在资源受限场景下进行高效微调。每个样本不仅提供标准的提示词与补全对,还保留了top-k演进信息,可支持对模型生成过程的分析与解读。测试字段的加入使得模型在训练后可直接进行单元测试评估,实现闭环验证。
使用方法
数据集以HuggingFace Datasets格式加载,默认配置仅包含一个训练集,用户可通过load_dataset函数直接读取。使用时应将prompt字段作为输入,completion字段作为目标输出,用于训练模型进行代码补全。task_id和entry_point可用于任务索引与函数入口定位,test字段包含测试用例,可在训练后调用外部执行环境进行正确性验证。建议配合代码执行沙箱,对模型生成的补全内容进行自动化测试评估。
背景与挑战
背景概述
该数据集由 autophagycode 团队于近期创建,基于 Qwen3-4B 模型,采用 trust 策略、温度系数 1.25 及生成轮次 6 构建,核心聚焦于代码生成任务中的可信赖性与质量评估。数据集包含 164 个训练样本,每个样本涵盖任务标识、函数入口、提示词、补全代码及 top-k 渐进结果,旨在探索大语言模型在代码补全场景下的鲁棒性与一致性。作为代码智能与可信 AI 交叉领域的创新资源,它弥补了现有数据集在细粒度代码生成策略比较方面的不足,为研究模型输出可靠性、温度控制对生成多样性的影响提供了重要基准,对推动自动化软件工程与可信代码生成技术发展具有潜在影响力。
当前挑战
数据集主要挑战涵盖两个方面:一是在领域问题层面,代码生成任务面临模型输出可信度评估困难,尤其是如何区分正确但非最优解与潜在错误代码,以及不同温度与策略组合下生成多样性对任务完成度的不确定影响;二是在构建过程中,样本数量有限(仅164条)可能限制统计显著性,top-k 渐进信息的高维特性增加了评估复杂性,同时需确保函数入口与测试用例的准确对应,以避免噪声干扰模型行为剖析的可靠性。
常用场景
经典使用场景
该数据集聚焦于代码生成任务中的信任校准与策略优化,特别针对数学推理与编程问题求解场景。数据集包含164个训练样本,每个样本由任务标识、入口函数、提示文本、补全代码、策略信任度演进轨迹及测试用例组成。经典使用方式是在强化学习框架中,利用信任度演进轨迹引导模型生成更可靠、鲁棒的代码补全,同时通过策略梯度方法优化模型对高难度问题的推理能力。这类数据常用于训练具备自我纠错与不确定性评估能力的代码生成模型。
实际应用
在实际应用中,该数据集可服务于智能编程辅助系统的开发。例如,集成到IDE插件中,帮助开发者在编写数学函数或算法实现时,获得带有置信度标记的代码建议。系统能在模型不确定性较高时主动提供多种备选方案或请求用户确认,从而减少生产环境中的隐蔽错误。此外,该数据也适用于自动化测试生成场景,通过信任度排序优先输出高可靠性的测试用例,提升软件质量保障效率。
衍生相关工作
基于该数据集衍生的经典工作包括:信任感知的策略梯度算法,通过融合top_k_progression特征改进PPO的采样策略;不确定性驱动的自我纠错框架,利用信任度演进轨迹训练模型迭代修正代码;以及多轮对话中的代码优化方法,将策略信任度作为强化学习奖励信号。这些工作进一步拓展了代码生成与推理信任度的交叉研究,促进了从确定性输出到概率性评估的范式转变。
以上内容由遇见数据集搜集并总结生成



