stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g8_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3595424 num_examples: 142 download_size: 415298 dataset_size: 3595424 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
在程序合成与自动化代码生成的研究脉络中,该数据集通过采集Qwen3-8B模型在特定解码参数下的生成轨迹构建而成。具体而言,以任务标识与入口点为索引,针对每个编程问题记录模型在温度系数0.75、分组数8以及学习率0.0001的配置下所生成的候选代码及其对应测试用例。所收录的142个训练样本经过去重与有效性筛选,确保每个条目均包含完整的提示词、补全代码以及前若干候选的递进序列,从而形成对模型推理路径的细粒度刻画。
特点
该数据集的核心特质在于其融入了信任度加权的采样策略,并以top-k递进序列作为显式监督信号。与常规代码生成语料不同,每一实例不仅提供最终补全结果,还保留了从高概率到低概率候选的演变过程,使得模型能够学习到输出分布中的不确定性结构。数据规模精简而信息密度较高,测试字段的并存进一步支持对生成代码进行正确性验证,适用于探究解码策略与代码质量之间的关联。
使用方法
使用该数据集时,研究者可将其直接载入HuggingFace数据集库,按train划分访问各字段。典型流程为:以prompt字段作为输入,completion作为监督目标,同时利用test字段执行单元测试以评估生成代码的功能正确性。top_k_progression字段可用于分析候选排序与信任度变化,辅助训练奖励模型或进行偏好优化。在微调或推理阶段,该数据亦适合作为代码生成模型的验证基准,以考察模型在不同采样温度下的稳健性与多样性。
背景与挑战
背景概述
随着大规模语言模型在代码生成领域的广泛应用,如何提升模型对复杂编程任务的求解能力成为学术界与工业界共同关注的焦点。该数据集由相关研究团队于2024年构建,基于Qwen3-8B模型,采用学习率0.0001、信任温度0.75等超参数配置,通过自回归生成方式采集了142个编程任务的提示与补全数据。其核心研究问题在于探索代码生成模型在推理过程中的渐进式优化机制,通过记录top-k概率演进轨迹,为理解模型决策过程提供了细粒度观测窗口,对代码智能与模型可解释性研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于代码生成模型对复杂算法任务的准确求解与推理路径的可追踪性,传统方法难以捕捉模型在生成过程中的动态概率变化。构建过程中面临多重挑战:其一,如何设计有效的提示与补全对以覆盖多样化的编程场景,同时保证任务难度分布合理;其二,top-k概率演进数据的采集与存储需兼顾信息完整性与计算效率;其三,在有限样本规模下确保数据质量与模型行为表征的可靠性,避免因采样偏差导致对模型能力的误判。这些挑战共同构成了该数据集在代码生成研究中的核心难点。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集凭借其独特的任务导向结构,经典地服务于基于执行反馈的迭代式代码优化场景。每条样本均封装了任务标识、入口点、自然语言提示、初始补全代码、top-k候选演进轨迹以及测试用例,使得研究者能够系统性地评估模型在动态调试与多轮修正中的表现。这种设计尤其契合需要检验代码功能正确性与鲁棒性的研究,例如通过top-k_progression字段追踪模型从错误到正确的推理路径,从而揭示代码大模型在自动纠错与程序精化方面的内在机制。
衍生相关工作
围绕该数据集,衍生出一系列聚焦于执行引导代码生成与自我调试的经典工作。受其启发,研究者探索了基于单元测试反馈的强化学习微调方法、利用top-k候选重排序的推理时优化策略,以及结合思维链与代码执行轨迹的混合推理框架。这些工作进一步拓展了数据集在程序合成、自动补丁生成与代码翻译等任务中的应用边界,并推动了面向真实软件工程需求的基准构建与模型评测体系建设。
数据集最近研究
最新研究方向
针对代码生成模型的自动化评估与优化,该数据集聚焦于利用强化学习与信任区域策略提升大语言模型的代码合成能力。其核心在于通过top-k概率 progression 与测试用例反馈,构建动态奖励信号,引导模型在探索与利用间取得平衡,从而生成更符合功能正确性的代码。当前研究热点集中于将此类数据集用于验证基于执行反馈的微调方法,如近端策略优化与拒绝采样,并探索代码生成中的不确定性量化与安全性对齐。该数据集的出现为代码大模型的可靠性评估提供了细粒度基准,推动了自动化编程助手在真实开发场景中的可信部署,对软件工程与人工智能交叉领域具有显著的实证价值。
以上内容由遇见数据集搜集并总结生成



