遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g6_run1

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3481552 num_examples: 142 download_size: 410484 dataset_size: 3481552 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g6_run1 数据集图片
构建方式
该数据集立足于代码生成模型的训练需求,以任务编号、入口点、提示词与补全结果为核心字段,通过自动化流程汇总142条训练样本。构建过程以Qwen3-8B模型为基座,在特定学习率与信任采样参数下执行多轮生成,并将top-k演进轨迹与测试用例一并留存,形成结构化的代码任务记录。每条样本独立标注,确保提示与补全之间的对应关系清晰可追溯,从而为后续模型行为分析提供原始依据。
特点
数据集呈现高密度结构化特征,包含任务标识、入口函数、自然语言提示、代码补全以及top-k渐进序列与测试代码等多元信息。样本规模精简至142条,单条数据体积较大,蕴含丰富的生成过程信号。字段设计兼顾模型输入与评估验证,既可用于监督微调,也可支撑解码策略与推理路径的细粒度研究,尤其适合关注代码生成质量与采样动态的学术探索。
使用方法
使用者可借助HuggingFace数据集接口直接加载训练分片,以提示词与补全字段进行条件生成任务的训练或评测。top-k_progression字段可用于分析解码过程中候选序列的演变规律,test字段则提供功能验证依据。通过task_id与entry_point的联合索引,可快速定位特定编程任务并实施对比实验,从而在代码智能与模型行为可解释性研究中发挥数据支撑作用。
背景与挑战
背景概述
在代码生成与程序合成研究持续深化的背景下,该数据集于2025年前后由相关研究团队构建,基于Qwen3-8B模型并以autophagycode_D_mercury为标识,聚焦代码生成任务中模型输出的质量评估与筛选。其核心研究问题在于探索学习率0.0001、信任阈值0.75与生成组数6等超参数配置下,模型对编程任务的理解与代码补全能力。数据集包含142个训练样本,覆盖任务标识、入口点、提示、补全内容、top-k递进轨迹及测试用例等字段,为代码生成模型的训练与评测提供了结构化支撑,对自动化编程与模型对齐研究具有一定参考价值。
当前挑战
该数据集所应对的领域问题在于代码生成模型在复杂编程任务中输出正确性与鲁棒性的评估难题,传统评测往往难以捕捉模型在多次采样与筛选过程中的动态表现。构建过程中面临多重挑战:其一,如何在有限样本规模下保证任务提示与测试用例的多样性和代表性;其二,如何有效记录并利用top-k递进轨迹以反映模型推理路径的演化;其三,超参数配置与信任机制的引入增加了数据标注与筛选的复杂性,需在生成质量与计算成本之间取得平衡。这些挑战共同构成了该数据集在代码生成研究中的应用边界与改进方向。
常用场景
经典使用场景
在程序合成与自动化代码生成的研究领域中,该数据集以任务标识、入口点、提示词、补全结果、top-k采样进程及测试用例为核心字段,构成面向代码生成模型微调与评估的经典资源。其142条训练样本聚焦于依据自然语言提示生成可执行代码,并借助测试字段验证生成结果的正确性。研究者常将其用于监督微调、拒绝采样及自一致性解码等场景,尤其在强化学习与采样温度调控实验中,top_k_progression字段为解码策略的逐步分析提供了细粒度观测。
解决学术问题
该数据集有效回应了代码生成研究中模型输出正确性难以量化、解码策略与生成质量之间关系模糊等核心难题。通过将提示、补全与测试用例紧密耦合,它为评估生成代码的功能正确性提供了可执行验证路径。同时,top_k_progression字段使研究者能够系统考察不同采样策略对代码质量的影响,从而推动对生成多样性与精确性之间权衡的深入理解,为代码大模型的训练与推理优化提供了实证基础。
衍生相关工作
围绕该数据集,后续研究多集中于代码大模型的微调策略、解码算法改进及自动化评估框架的构建。相关经典工作包括基于拒绝采样的代码生成优化、利用执行反馈进行强化学习的代码模型训练,以及针对top-k采样与温度参数的系统性消融实验。这些工作进一步拓展了数据集在代码正确性验证与生成策略分析方面的应用边界,并催生了若干面向函数级代码生成的基准测试与评估方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务