遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g6_run1

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4863309 num_examples: 164 download_size: 590777 dataset_size: 4863309 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g6_run1 数据集图片
构建方式
在程序合成与自修复代码生成的研究脉络中,该数据集依托自动化代码评估与迭代优化机制构建而成。其生成过程以任务标识与入口点为索引,采用Qwen3-8B模型在温度系数0.75、分组规模6的条件下进行策略信任采样,并将每一轮采样中的候选方案以top_k_progression字段记录,形成从初始生成到逐步筛选的完整轨迹。最终保留164条训练样本,以提示、补全及测试用例三元组的形式固化,从而为代码生成模型的训练与评估提供带有过程信息的结构化语料。
特点
该数据集的核心特质在于将代码生成任务与迭代筛选轨迹相耦合。每条样本不仅包含任务标识、入口点、自然语言提示与模型补全,还通过top_k_progression字段保留了候选代码在逐步筛选过程中的演变信息,并配有可执行的测试用例。这种设计使数据集同时承载静态代码文本与动态评估信号,便于研究者分析模型生成行为的稳定性、多样性及收敛特征,亦可用于监督微调、偏好建模或过程奖励建模等场景。
使用方法
使用该数据集时,可将其载入HuggingFace datasets库,直接访问train划分中的164条样本。训练阶段,可将prompt与completion拼接为语言建模语料,或利用test字段构建执行反馈信号,对生成代码进行正确性校验。top_k_progression字段支持对候选代码筛选过程进行细粒度分析,适用于研究采样策略与代码质量之间的关系。评估时,可依据entry_point与test构造单元测试,统计通过率与执行效率,进而比较不同模型或解码策略在代码合成任务上的表现。
背景与挑战
背景概述
近年来,代码生成与程序合成领域呈现出蓬勃发展的态势,大规模语言模型在自动化编程任务中的应用日益广泛。该数据集由相关研究团队于近期构建,旨在探索基于策略信任机制的代码生成方法,核心研究问题在于如何利用大语言模型在给定任务描述和入口点的条件下,生成高质量、可执行的代码补全方案。数据集包含164个训练样本,覆盖了任务标识、提示词、补全代码及测试用例等字段,为评估模型在代码生成任务中的表现提供了细粒度支撑,对推动自动化编程技术向更稳健、更可控的方向发展具有积极意义。
当前挑战
该数据集所面对的挑战体现在多个层面。从领域问题来看,代码生成任务本身要求模型在语义理解、语法正确性、逻辑完备性及执行效率之间取得精妙平衡,而真实编程场景中任务描述的歧义性和边界条件的复杂性进一步加剧了生成难度。在构建过程中,数据采集需确保任务描述与测试用例之间的严格一致性,避免因测试覆盖不足而导致评估偏差;同时,样本规模的有限性对模型泛化能力提出了更高要求,如何在此条件下保持生成代码的鲁棒性和可执行性,构成了该数据集应用中的核心难题。
常用场景
经典使用场景
在代码生成与程序合成研究领域,该数据集典型地服务于基于执行反馈的迭代式代码优化任务。每条样本包含任务标识、函数入口点、自然语言提示、模型生成的代码补全、多轮候选序列的得分演进轨迹以及单元测试用例,构成了完整的“生成-评估-筛选”闭环。研究者常将其用于训练奖励模型或过程监督模型,使语言模型能够在多轮采样中依据测试通过率与候选排序信号逐步逼近正确实现,从而提升复杂编程问题的求解成功率。
实际应用
在实际软件工程场景中,该数据集支撑智能编程助手在真实开发环境下的自动纠错与补全迭代。借助其中蕴含的测试用例与多轮候选演进信息,工程团队可构建面向持续集成流程的代码审查代理,对模型输出进行自动验证与择优采纳;亦可将其用于构建领域适配的代码评测基准,衡量不同模型在函数级合成任务上的稳定性。此类应用直接降低了人工复核成本,并为可信赖的机器编程奠定了数据基础。
衍生相关工作
围绕该数据集所代表的执行反馈式代码生成范式,后续研究衍生出多条经典脉络。其一为过程奖励模型,通过拟合候选序列的排序轨迹实现对中间步骤的密集评分;其二为迭代式自我修复框架,利用测试反馈驱动模型多轮改写;其三为基于拒绝采样的监督微调与直接偏好优化,将高得分候选转化为训练信号。这些工作共同推动了代码大模型从单次生成向可验证、可迭代的问题求解范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务