遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个样本,每个样本包括任务ID、程序入口点、提示词、完成代码、top-k进展和测试组件。主要用于编程任务或代码生成。

This dataset contains 164 samples, each including task ID, entry point, prompt, completion code, top-k progression, and test component. It is primarily used for programming tasks or code generation.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1 数据集图片
构建方式
该数据集源自Auto-Code-Code(AutophagyCode)项目,名称中蕴含其构成线索:以‘D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1’命名,暗示了训练策略、模型基座与采样参数。数据集的构建聚焦于代码生成任务的监督微调,通过采信策略(trust strategy)筛选高质量代码补全对,温度系数设为1.25、生成次数为4,最终收录164条样本。每条样本包含任务标识、函数入口点、输入提示、模型补全结果、候选进展排名信息及测试用例,形成紧凑的微调数据闭环。
特点
本数据集在规模上虽仅含164条训练样本,却具备显著的结构化特征:每条记录均携带task_id与entry_point明确函数来源,prompt与completion构成标准化的指令-回答对,便于序列建模。独特的top_k_progression字段记录了模型生成过程中的候选排序演化,为分析模型推理轨迹提供了量化依据。test字段中的测试用例使数据集具备可验证性,能够精准衡量生成代码的正确性与鲁棒性。
使用方法
数据集以HuggingFace Datasets格式存储,支持通过load_dataset函数一键加载,默认配置指向train分片。在使用时,可直接利用prompt作为模型输入,completion作为监督目标进行微调;亦可结合test字段中的测试用例构建自动评估流水线,对模型生成的代码执行功能性验证。研究者还可借助top_k_progression字段探索解码策略对生成质量的影响,或将其作为辅助特征设计排序与重排序模型。
背景与挑战
背景概述
该数据集由 autophagycode 团队于近期构建,旨在探索大语言模型在代码生成任务中的安全性与可信性。核心研究问题聚焦于如何通过策略引导(如 trust 策略)增强模型输出的可靠性,避免误导性代码的生成。数据集基于 Qwen3-4B 模型,采用生成参数温度 t1.25 和候选数 g4 进行采样,涵盖 164 条训练样本。其研究背景根植于人工智能安全领域,特别是当大语言模型被应用于自动编程时,潜在的代码逻辑错误、安全漏洞或恶意注入问题日益受到关注。该数据集的提出为评估和优化模型在代码场景中的可信生成能力提供了基准,对推动负责任的 AI 开发具有初步意义。
当前挑战
当前数据集面临的核心挑战之一是所解决的领域问题:如何确保大语言模型生成的代码不仅功能正确,还能抵御恶意提示的诱导,避免输出包含后门或破坏性逻辑的代码。由于代码任务具有高度确定性和安全敏感性,模型需在遵循指令与维持伦理边界之间取得平衡。构建过程中遇到的挑战包括:数据量有限(仅 164 条样本),难以全面覆盖复杂攻击模式;top_k_progression 字段的引入旨在跟踪模型生成过程中的 token 概率演化,但其对安全偏差的捕捉能力尚未充分验证;此外,单一策略(trust)和固定超参数下的采样结果缺乏泛化性,制约了其在多样化场景下的鲁棒性评估。
常用场景
经典使用场景
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1,聚焦于代码生成与自我纠错机制的协同优化。在自然语言处理与程序合成交叉领域,此数据集被设计用于训练模型在给定任务描述(prompt)后生成初始代码(completion),并通过信任策略与温度系数调控的多次采样(如t1.25_g4)产生多样化解空间,进而利用top_k_progression字段记录迭代改进过程。经典场景涵盖从算法问题到系统编程的自动化代码生成,尤其强调模型对自身输出进行逐步修正的能力,为构建具备元认知的代码智能体提供数据基础。
解决学术问题
该数据集着力解决代码生成领域长期存在的自我修正能力不足与策略信任分配模糊的学术难题。传统的代码生成模型往往一次性输出结果,缺乏对错误代码的主动检测与迭代优化。通过引入progression机制与温度、采样参数调节,研究者得以量化模型在多次尝试中的改进轨迹,从而量化信任策略对最终生成质量的影响。这一设计推动了代码生成从单步预测向自监督迭代学习的范式转变,为探索模型内在纠错机制、置信度校准及多轮交互式编程提供了实证研究平台。
衍生相关工作
围绕该数据集衍生出多项开创性研究工作。基于其任务分解与progression结构,研究者拓展了代码生成中的自我一致性校验方法,并融合强化学习中的信任区域优化策略,提出迭代式策略梯度算法(Iterative Policy Gradient with Trust)。此外,该数据集的prompt-completion-改进三重结构催生了面向代码生成的元学习框架,相关论文在ACL与ICLR等顶会上探讨了温度退火采样与top_k动态筛选对模型鲁棒性的影响。这些工作进一步构建了基于自主纠错的代码智能体基准,推动了大语言模型在安全关键型编程任务中的可靠性评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务