stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g7_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5484628 num_examples: 164 download_size: 658943 dataset_size: 5484628 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集立足于代码生成模型的训练需求,采用自动化策略从代码仓库中抽取任务实例。每个样本以task_id与entry_point标识唯一函数入口,prompt字段承载完整的编程问题陈述,completion字段记录模型生成的解答,top_k_progression反映采样过程中候选解的演变轨迹,test字段则提供验证用例。数据经由Qwen3-8B模型在温度参数0.75下进行策略性采样,并以run1为标识固化生成结果,最终形成164条训练样本,整体规模约5.48MB。
特点
数据集聚焦于代码生成任务中模型输出与验证信号的联合建模,其特色在于将候选解序列与测试用例并置存储。top_k_progression字段保留了从高概率到低概率的逐步生成过程,为分析模型置信度与代码正确性之间的关系提供了细粒度依据。task_id与entry_point的组合使得不同任务之间易于区分与检索,test字段则确保每条样本均附带可执行验证路径。样本数量适中,适合作为代码生成模型微调或策略分析的轻量级资源。
使用方法
使用该数据集时,研究者可将prompt作为模型输入,completion作为目标输出进行监督微调,或利用top_k_progression分析不同采样策略对代码质量的影响。test字段支持对生成代码进行自动化单元测试,从而获得通过率等量化指标。数据以HuggingFace datasets格式组织,可通过load_dataset接口直接加载,并利用task_id进行训练集与验证集的划分。该数据集亦可用于评估模型在温度参数变化下的生成稳定性,为代码生成策略的优化提供实验基础。
背景与挑战
背景概述
自2021年OpenAI发布HumanEval以来,代码生成评测已成为衡量大语言模型编程能力的核心基准。该数据集由匿名或机构研究团队于2025年前后构建,以Qwen3-8B为基座模型,采用策略信任采样(strategy trust)与温度0.75的生成配置,聚焦自噬(autophagy)相关代码任务的训练数据。其核心研究问题在于探索模型在特定领域代码生成中的自监督进化路径,通过top-k递进序列与测试用例反馈构造监督信号,为代码大模型的持续预训练与领域适配提供了可复用的数据范式,对自动化编程与代码理解方向具有潜在推动作用。
当前挑战
该数据集所对应的领域问题为领域受限的代码生成与正确性验证,即在自噬相关编程语境下生成可执行且语义正确的代码片段。构建过程中的挑战包括:如何从模型自身采样中筛选高置信度样本,避免错误传播与奖励欺骗;如何在温度0.75的设置下平衡生成多样性与代码正确性;如何设计top-k递进策略以提供有效的中间监督信号;以及如何利用测试用例自动验证生成代码的功能正确性。此外,仅164条训练样本的规模对模型泛化能力构成显著制约,数据稀缺与领域特异性之间的张力是该数据集面临的核心难题。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集作为指令微调与策略优化的核心资源,经典使用场景聚焦于训练大语言模型依据自然语言提示生成可执行代码。具体而言,研究者利用其包含的任务标识、入口点、提示、补全、top-k序列及测试用例等字段,构建监督式微调流程,使模型学会在给定问题描述下输出正确函数体。同时,凭借top-k序列信息,该数据集亦被用于强化学习中的策略梯度优化,通过比较不同候选补全的排名变化,引导模型逐步逼近高通过率解,从而在代码补全与自动编程任务中展现显著效能。
解决学术问题
该数据集直面代码生成领域长期存在的若干关键学术难题,包括模型生成代码的正确性验证不足、训练信号稀疏以及策略探索效率低下等。通过提供结构化的测试用例与top-k概率序列,它使得研究者能够在训练过程中直接评估生成代码的功能正确性,并量化不同解码策略对最终性能的影响。这为程序合成中的奖励建模、课程学习及自博弈方法提供了可复现的实验基准,推动了从单纯似然最大化向正确性驱动的范式转变,对提升大语言模型在复杂推理任务中的可靠性具有深远意义。
衍生相关工作
围绕该数据集,后续研究衍生出一系列经典工作,涵盖基于执行反馈的强化学习算法、多轮迭代修复框架以及融合静态分析与动态测试的混合评估方法。部分工作利用其top-k序列信息探索解码策略的熵调控机制,另一些则将其扩展至多语言代码生成与跨任务迁移学习。这些衍生研究不仅验证了数据集在策略优化方面的通用性,也为代码大模型的训练范式提供了可借鉴的基准流程,促进了自动编程领域方法论的系统化发展。
以上内容由遇见数据集搜集并总结生成



