遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g3_run1

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5341004 num_examples: 164 download_size: 726680 dataset_size: 5341004 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g3_run1 数据集图片
构建方式
该数据集脱胎于程序合成与自动化代码生成的研究脉络,旨在通过思维链数据刻画代码生成模型的内部推理过程。构建时以autophagycode_D_he_train为初始样本,借助mercury_Qwen3-8B策略模型,在温度参数0.75、采样数3的设置下执行首轮生成,并记录top_k_progression字段以保留逐步筛选的候选路径。每条样本包含任务标识、入口点、自然语言提示、模型补全及测试用例,最终形成164条训练实例,为分析模型决策轨迹提供了细粒度依据。
特点
数据集的核心特质在于其双轨信息结构:一方面通过prompt-completion对呈现标准监督信号,另一方面以top_k_progression字段编码生成过程中的概率演化序列,从而将传统静态代码语料拓展为动态推理记录。所有样本均附带可执行的test单元,确保生成结果可被自动化验证。任务覆盖多样化的函数签名与逻辑语义,数据规模适中而信息密度较高,尤其适合考察模型在代码生成任务中的探索行为与偏好分布。
使用方法
研究人员可将数据集直接载入HuggingFace datasets库,利用train划分进行监督微调或强化学习训练,其中completion字段作为目标输出,prompt字段提供输入上下文。top_k_progression字段适用于分析生成策略的时序特性,test字段则支持构建执行反馈回路,用于评估功能正确性。该数据集亦可用于对比不同解码策略对代码质量的影响,或作为元学习任务中策略信任度研究的基准语料。
背景与挑战
背景概述
该数据集衍生自程序合成领域的自动化代码生成研究,由研究团队于2025年前后构建,聚焦于通过大语言模型生成Python函数体以解决特定任务。其核心研究问题在于探索策略信任机制(strategy trust)在自回归代码生成中的效用,尤其是以Qwen3-8B为基座模型,结合温度参数t=0.75与三组采样(g3)的配置,生成带执行反馈的代码补全数据。数据集包含任务标识、入口点、提示、补全、top-k进展及测试用例等字段,旨在为代码生成模型的训练与评估提供细粒度监督信号。该数据集对程序合成与自动化调试领域具有潜在影响力,为理解模型在受限搜索下的代码修复与优化行为提供了实证基础。
当前挑战
该数据集所应对的领域问题在于复杂编程任务的自动求解与代码可靠性验证,要求模型在给定自然语言提示与函数签名的条件下生成语义正确且通过测试的代码,其难度源于程序语义的精确性要求与多步推理需求。构建过程中面临的挑战包括:采样策略需在探索与利用间取得平衡,温度参数与分组采样的设置可能影响生成多样性及收敛性;top-k进展字段的标注需从执行轨迹中提取有效信号,涉及对中间状态与最终结果的因果推断;测试用例的覆盖与质量直接决定数据可信度,而自动化过滤可能引入噪声或偏差。此外,164个训练样本的规模限制了对模型泛化能力的全面评估,数据构建与验证流程的可复现性亦需进一步保障。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集凭借其精细的任务标识与代码补全结构,常被用于评估大语言模型在复杂编程情境下的推理与生成能力。通过提供任务描述、入口函数、提示语以及包含前k个候选程序的进展序列,研究者可系统分析模型如何逐步逼近正确解。此类场景下,数据集成为检验生成式模型代码理解与迭代优化策略的经典试验台。
解决学术问题
该数据集直面代码生成中程序正确性与多步推理耦合的难题。传统基准多聚焦单步生成,难以刻画模型在长程依赖下的自我修正能力。此数据集通过记录候选程序的演化轨迹,为研究模型如何利用测试反馈进行自我调试与搜索提供了量化依据,进而推动程序合成、强化学习与代码大模型交叉领域的理论进展。
衍生相关工作
围绕该数据集,后续研究衍生出基于执行反馈的迭代式代码生成框架、融合搜索与学习的混合推理模型,以及针对候选程序排序的对比学习方法。这些工作进一步拓展了代码大模型在复杂算法题、单元测试生成与自动程序修复等方向的应用边界,并催生了若干公开基准与开源工具链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务