遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g1_run1

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4663858 num_examples: 142 download_size: 802139 dataset_size: 4663858 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g1_run1 数据集图片
构建方式
该数据集立足于代码生成模型的训练需求,借助自动化生成与筛选流程构建而成。以Qwen3-8B模型为基座,在特定学习率(0.0001)与超参数配置下,围绕142个代码任务生成候选程序,并引入“信任”机制对输出进行质量评估与优选。每个样本包含任务标识、入口函数、提示词、补全代码、top-k渐进信息及测试用例,最终形成结构化的训练集,旨在为代码模型的优化提供精炼且可控的微调语料。
特点
数据集规模紧凑,仅含142个训练样本,却涵盖任务从提示到测试的完整链路。每个实例不仅提供代码补全内容,还保留了top-k候选的渐进式信息,可用于分析模型生成过程中的偏好演化。任务入口点与测试字段的并存,使得代码正确性可被即时验证。数据集整体以信任度为筛选标尺,体现了对生成质量而非单纯数量的追求,适合作为小规模、高信息密度的评估基准。
使用方法
该数据集可通过HuggingFace的datasets库便捷加载,默认配置下自动获取train划分。研究者可借助task_id与entry_point字段定位具体编程问题,利用prompt与completion进行指令微调或继续预训练。test字段支持执行单元测试以验证生成代码的功能正确性,而top_k_progression则为分析解码策略提供依据。该数据集适用于代码生成模型的轻量化微调、信任度校准及少样本场景下的性能评估。
背景与挑战
背景概述
代码生成模型的评估与优化长期依赖静态基准,难以动态刻画模型在推理过程中的行为演化。2024年前后,随着大语言模型在程序合成领域的广泛应用,研究者开始探索利用推理轨迹与测试反馈来构建更具诊断性的数据集。autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g1_run1数据集正是在此背景下由相关研究团队构建,其名称编码了模型标识、学习率与采样参数等训练配置,核心研究问题在于通过top-k概率递进与测试用例的配对,揭示代码生成模型在自回归解码中的置信度变化与正确性之间的关联,为代码生成的过程性评估提供了细粒度资源,对程序合成与模型可信度研究具有推动作用。
当前挑战
该数据集所应对的领域问题在于代码生成模型评估通常仅关注最终输出是否正确,而忽视了生成过程中模型不确定性的动态变化,难以诊断模型在中间步骤的推理偏差。构建过程中,如何确保top-k概率递进序列与测试用例的严格对齐、如何从模型采样中筛选出具有代表性的142个样本、以及如何平衡任务多样性与数据规模,均构成显著挑战。此外,将模型内部概率信息与外部测试反馈融合为结构化字段,需解决格式统一与语义一致性问题,以保证数据集在过程性代码生成研究中的可用性与可复现性。
常用场景
经典使用场景
在代码生成与程序合成领域,该数据集依托Qwen3-8B模型,针对编程任务构建了包含任务标识、入口点、提示、补全结果、top-k演化序列及测试用例的监督式微调语料。其经典使用场景聚焦于训练模型依据自然语言描述生成可执行代码,并通过top_k_progression字段追踪多候选生成过程中的逐步优化路径,从而在代码补全、函数级生成及测试驱动开发等任务中提供细粒度监督信号。
实际应用
在实际软件开发场景中,该数据集可用于微调面向特定编程语言的代码助手,辅助开发者完成函数实现、单元测试生成与代码修复等任务。top_k_progression字段支持构建交互式代码推荐系统,依据历史生成路径动态调整候选排序。测试字段则保障生成代码可通过自动化验证,降低集成风险,适用于持续集成环境中的代码质量保障与教育编程平台中的自动评分与反馈。
衍生相关工作
以该数据集为基础,后续工作可延伸至多轮代码编辑、基于执行反馈的强化学习微调以及跨语言代码迁移等方向。其结构设计启发了对生成过程进行细粒度追踪的代码数据集构建范式,相关研究可借鉴top_k_progression机制开展候选重排序、推理路径可视化与错误传播分析,进而推动代码大模型在复杂软件工程任务中的可信部署与持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务