stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4612647 num_examples: 164 download_size: 1073970 dataset_size: 4612647 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集基于自动化代码补全与多轮修正策略构建,利用Qwen3-4B模型对初始代码生成结果进行迭代优化,结合信任度阈值(trust_t1.1)与生成轮次(g5)控制生成质量。数据经两轮筛选与增强(run2),最终收录164条高质量训练样本,每条样本包含唯一任务标识、函数入口点、提示文本、补全结果、渐进式优化过程记录及测试用例。
特点
数据集呈现出精炼且聚焦的特点,仅涵盖164条样本,却完整记录了从初始提示到多轮优化完成的代码生成全链路信息。每项任务均包含渐进式优化轨迹(top_k_progression),可追踪模型在信任度策略下的逐步改进过程,同时附带测试用例确保补全结果的正确性与可验证性。
使用方法
该数据集专为训练代码生成模型设计,可直接加载为监督学习格式,其中prompt字段作为输入,completion字段作为目标输出。用户亦可利用top_k_progression字段构建强化学习或对比学习任务,通过模型渐进式优化轨迹设计奖励信号,测试用例可应用于自动化评估逻辑正确性。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run2,由香港中文大学(深圳)的OpenAutoResearch团队于2025年创建,旨在探索大语言模型在代码生成任务中的自我纠错与信任校准能力。核心研究问题聚焦于如何通过迭代式自进化策略提升模型生成代码的可靠性,尤其在复杂编程场景下。该数据集以Qwen3-4B为基座模型,结合基于信任分数(trust score)的采样策略,产出164条高质量训练样本,每条包含任务标识、入口点、提示词、代码补全、Top-K进展及测试用例。这一工作为自进化代码生成领域提供了首个多轮迭代的基准数据,推动了大模型在自动化编程中的可信度研究。
当前挑战
数据集所解决的领域挑战在于大语言模型在代码生成任务中普遍存在的‘盲目自信’与错误循环修复问题。传统模型常因缺乏有效自我评估机制而无法识别自身错误,导致修复后代码仍存在隐蔽缺陷。构建过程中的挑战则包括:1)如何设计多轮迭代框架以避免模型陷入局部最优修复路径;2)如何在有限样本量(164条)下平衡探索与利用,确保数据覆盖异构错误类型;3)如何定义并计算信任分数,使模型在渐进式修正中保持鲁棒性。此外,策略参数(如top_k_progression)的精细调优需兼顾效率与效果,这对资源受限环境下的实际部署构成额外障碍。
常用场景
经典使用场景
在代码生成与程序合成领域,该数据集聚焦于通过自噬机制(autophagy)驱动的代码迭代优化过程,经典使用场景为训练语言模型在给定问题描述(prompt)与初始代码入口(entry_point)的基础上,逐步生成更优质的代码补全序列(completion)。其独特之处在于引入了信任策略(trust strategy)与渐进式排名(top_k_progression)机制,使得模型能够模拟开发者不断重构与自我改进的思维链条,从而提升代码的正确性与鲁棒性。
解决学术问题
该数据集致力于解决代码生成中缺乏自我修正与渐进式优化能力的学术痛点。传统方法往往一次性生成最终答案,忽视了中间推理与调试环节。通过记录代码从初始状态到优质解的演化路径,研究者得以探索“模型如何从失败中学习”这一核心问题,为程序合成中的自动调试、反馈驱动优化及可信代码生成提供了新的研究范式与定量分析基础。
衍生相关工作
该数据集衍生的工作方向包括:基于渐进式排名的强化学习代码优化策略(如利用信任分数引导搜索),以及多轮交互式代码修复框架(将top_k_progression融入解码过程)。相关研究可能进一步推动了“代码自进化”类模型的诞生,例如将自噬机制迁移至单元测试生成、API序列预测等任务,形成以自我反思为核心的技术路线,对程序合成领域产生了深远影响。
以上内容由遇见数据集搜集并总结生成



