遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run0

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,每个示例具有以下字段:task_id(任务标识符)、entry_point(入口点)、prompt(提示文本)、completion(完成文本)、top_k_progression(top_k进展信息)和test(测试信息)。数据集主要用于代码生成、任务完成或相关NLP任务,总大小约为2.66 MB。

This dataset contains 164 training examples, each with the following fields: task_id (task identifier), entry_point (entry point), prompt (prompt text), completion (completion text), top_k_progression (top_k progression information), and test (test information). The dataset is primarily used for code generation, task completion, or related NLP tasks, with a total size of approximately 2.66 MB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
本数据集旨在解决代码生成领域中的自我提升与强化学习问题,聚焦于提升模型在复杂编程任务中的推理与修正能力。数据集基于Mercury-Qwen3-8B模型,通过一种名为‘trust’策略的迭代方法构建。该策略以温度参数t=1.25和生成数量g=10为基础,针对初始训练样本进行多轮采样与筛选,最终从top_k_progression字段记录的渐进式迭代中提取高质量的代码补全结果。所有样本均涵盖函数入口点、任务提示、测试用例及对应的代码补全,形成自洽的训练闭环。
特点
该数据集呈现出明显的迭代优化特性,每个样本均包含task_id和entry_point以唯一标识编程任务,而prompt与completion字段则构成基础的输入-输出对。核心特征在于top_k_progression字段,它记录了模型在多次采样中的最佳进展序列,揭示了从初始错误到最终正确的修正轨迹。此外,test字段提供了验证代码正确性的测试用例,使得数据集不仅适用于监督微调,还支持基于反馈的强化学习训练。共包含164个训练样本,每个样本经过多步细化,确保了数据的多样性与鲁棒性。
使用方法
使用该数据集时,推荐采用监督微调与强化学习结合的两阶段策略。首先,利用prompt与completion字段对Qwen3-8B或类似规模的代码模型进行初始微调,使其学习基本的代码生成模式。随后,借助top_k_progression字段中的逐步改进过程,设计奖励模型以评估每一步代码的正确性与效率,通过策略梯度算法(如PPO)促进模型在复杂任务中的自我修正能力。test字段可用于离线评估,或在强化学习环境中作为奖励信号的验证标准。数据集的训练集格式兼容HuggingFace Datasets库,可直接通过load_dataset加载并使用。
背景与挑战
背景概述
在代码生成与程序合成领域,大型语言模型(LLMs)的自我反思与迭代优化能力成为提升生成质量的关键挑战。该数据集由阿里巴巴通义千问团队于2025年创建,基于Qwen3-8B模型,通过一种名为“自噬码”的信任策略(strategy_trust)进行训练数据构建,旨在探索模型如何利用自身生成的程序来指导后续修正,从而减少对外部标注的依赖。数据集包含164个训练样本,每个样本由任务标识、入口函数、提示词、补全代码、前k步进展以及测试用例组成,聚焦于解决编程任务中的长程推理与逐步修正问题。该数据集的研究价值在于推动了自我改进型代码智能体的发展,为自动化程序修复与动态策略优化提供了结构化数据支撑,对AI辅助编程工具的鲁棒性和泛化能力具有重要影响。
当前挑战
当前面临的核心挑战之一是如何在有限样本(仅164例)条件下,实现从自我生成代码中提取有效修正信号,避免因模型置信度偏差导致错误循环强化。在构建过程中,温度参数(t=1.25)与生成步数(g=10)的设置需要精确平衡探索与利用,过高的温度可能引入噪声,过低则限制多样性。此外,信任策略(strategy_trust)的设计需解决模型对自身生成结果的过度信任问题,防止低质量代码被错误地用作正向反馈,同时需确保top_k进展序列(top_k_progression)能真实反映逐步优化过程而非局部最优解。该数据集还面临跨任务泛化性挑战,如何在异构编程问题间迁移自我修正能力,避免过拟合于特定任务模式,是推动该方向实际应用的关键瓶颈。
常用场景
经典使用场景
该数据集聚焦于代码生成领域中的自噬性代码进化任务,通过构建一组包含任务标识、函数入口点、提示文本、补全代码及测试用例的结构化样本,为研究者提供了探索大语言模型在代码补全与迭代优化中行为模式的实验平台。经典使用场景包括训练和评估模型在给定函数签名与需求描述时,生成高质量、可执行代码段的能力,尤其适用于研究模型如何基于历史生成结果逐步改进输出质量,从而推动代码智能合成技术的发展。
衍生相关工作
基于该数据集衍生的工作主要包括两类研究方向:一是探索强化学习策略在代码生成中的应用,利用数据集中的渐进式优化轨迹训练模型在模拟环境中进行自我改进;二是开发针对代码迭代过程的评估指标体系,如引入父代与子代代码的语义相似度度量方法。此外,有研究团队以此为基础构建了多任务学习框架,将代码补全与测试验证联合建模,显著提升了模型在复杂编程场景下的泛化能力。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成任务的自动化验证与信任机制构建,融合了基于Qwen3-8B大语言模型的策略优化与自适应阈值调控(温度参数t=1.25,生成轮次g=10),在自噬相关蛋白质序列的代码补全与功能预测前沿方向展现出独特价值。通过引入top-k动态演进与多轮信任评分策略,该数据集的训练划分(164例样本)为探索少样本情境下大模型代码生成的可解释性与鲁棒性提供了实验基石,呼应了当前AI for Science领域对可复现、可审计的编码基准数据集的热切需求。其‘mercury’命名隐含对快速、高精度推理管线的追求,预示着在蛋白质互作网络模拟与自噬通路计算建模等热点事件中,该数据集将成为验证大语言模型能否突破传统生物信息学瓶颈的关键测试床。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务