遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g8_run0

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4190385 num_examples: 142 download_size: 478294 dataset_size: 4190385 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g8_run0 数据集图片
构建方式
该数据集立足于程序合成与自动化代码生成的研究背景,以Qwen3-8B模型为生成引擎,采用学习率0.0001进行精细化微调,并借助信任采样策略(trust sampling)与温度系数0.75的联合调控,从Mercury代码数据池中定向筛选出142个高质量样本。每个样本均包含从函数签名、提示文本到完整代码实现的端到端结构,且通过top_k_progression字段记录了生成过程中候选代码的逐步筛选轨迹,测试用例亦同步嵌入,确保数据在正确性与多样性之间达到均衡。
特点
数据集呈现显著的领域导向性与结构完整性。其样本规模虽精炼至142条,却覆盖了代码生成任务的核心要素——任务标识、入口函数、自然语言提示、参考实现、渐进式候选序列及测试验证,形成闭环的监督信号。top_k_progression字段的引入尤为独特,它不单记录最终输出,更保留了候选代码在生成过程中的演化信息,为分析模型决策路径提供了细粒度依据。所有样本均源自Qwen3-8B在特定超参数下的产出,兼具模型表征与任务多样性。
使用方法
在具体使用中,研究者可将数据集按默认配置直接加载,利用train分片进行模型微调或提示工程评估。prompt与completion字段支持标准的监督式训练范式,而test字段可用于自动化功能验证,评估生成代码的通过率。top_k_progression字段则适用于分析生成多样性或开展对比解码研究,帮助理解不同候选路径的优劣。该数据集适配于代码生成、程序理解及模型行为分析等场景,使用时建议结合具体任务对字段进行选择性加载,以充分发挥其结构优势。
背景与挑战
背景概述
该数据集聚焦于代码生成模型的自动化质量评估与筛选,由研究团队基于Qwen3-8B模型构建,采用信任度加权的采样策略生成142条编程任务样本。核心研究问题在于探索如何利用自回归语言模型在代码补全任务中的生成概率分布,对生成结果进行自动化的正确性判别与排序。数据集记录了任务标识、入口函数、提示词、补全内容、top-k渐进分布以及测试用例等多元信息,为代码生成质量的无监督评估方法研究提供了细粒度文本信号,对推动自动化编程教育及智能编程助手领域的发展具有潜在价值。
当前挑战
该数据集所对应的领域问题在于代码生成结果的自动化正确性判定与质量排序,传统方法依赖测试用例执行或人工标注,难以在缺乏执行环境或标注成本高昂的场景下扩展。构建过程中面临多重挑战:生成样本需覆盖多样化的编程任务语义与复杂度,同时保持任务描述的清晰性;top-k渐进分布的采集要求模型在生成过程中保留完整的概率轨迹信息,对计算与存储资源提出较高要求;信任度加权机制的设计需平衡采样多样性与样本质量;此外,仅142条训练样本的规模限制了模型泛化能力的验证,测试用例的完备性与边界条件覆盖亦构成潜在制约。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集常被用于评估和微调基于强化学习的大语言模型在代码补全任务上的表现。其核心使用场景在于:给定一个函数签名与文档注释,模型需生成通过单元测试的完整函数体。数据集中包含的任务编号、入口点、提示、补全、前k个候选的演进轨迹以及测试用例,共同构成了一个闭环的代码生成与验证环境,尤其适用于研究模型如何在训练过程中利用测试反馈进行自我修正与迭代优化。
实际应用
在实际软件开发辅助工具中,该数据集所支持的训练范式可部署于集成开发环境或代码审查平台,用于自动补全函数实现、生成单元测试草稿或修复简单缺陷。其基于测试执行反馈进行优化的特性,特别适合需要高可靠性的场景,例如竞赛编程辅助、教育编程平台的自动评分与提示系统,以及面向特定领域(如数据处理、算法实现)的代码片段自动生成,从而减少开发者编写样板代码的时间。
衍生相关工作
围绕该数据集衍生的经典工作多见于强化学习与代码生成的交叉领域。例如,基于其训练流程改进的奖励塑形策略、结合执行反馈的迭代式代码修复模型、以及针对top-k候选演化机制的分析性研究。这些工作进一步推动了测试驱动代码合成基准的建立,并启发了后续在更大规模代码库上应用类似训练范式的尝试,如将执行反馈与静态分析信号融合的混合奖励模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务