stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t0.75_g7_run0
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3929955 num_examples: 142 download_size: 458840 dataset_size: 3929955 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
在代码生成与程序合成研究领域,面向复杂推理任务的训练数据构建尤为关键。该数据集通过自动化流水线生成,基于Qwen3-8B模型在特定超参数配置下进行采样与筛选,最终保留142个训练样本。每个样本均围绕函数级代码任务展开,包含任务标识、入口点、提示词、补全代码、top-k渐进信息以及测试用例,形成从问题描述到可执行验证的完整闭环。数据生成过程采用了温度系数0.75与分组大小7的采样策略,并通过信任机制对候选输出进行过滤,确保样本质量与多样性之间的平衡。
特点
该数据集的核心特征体现在函数级编程任务的细粒度标注与验证信息的完备性上。每一实例不仅提供自然语言提示和对应代码补全,还整合了top-k渐进序列与测试用例,便于评估模型在逐步推理过程中的表现。数据集规模精炼,仅含142个训练样本,适用于轻量级微调或针对性评估。所有字段均为字符串类型,结构统一,便于直接加载与解析。任务标识与入口点的设计使得样本可追溯、可复现,为代码生成模型的鲁棒性分析提供了可靠基础。
使用方法
使用该数据集时,研究人员可将其直接加载为HuggingFace数据集对象,按train划分访问全部142个样本。典型应用场景包括代码生成模型的监督微调、推理路径分析以及测试驱动的评估。通过解析prompt与completion字段,可构建输入输出对用于训练;top_k_progression字段支持对生成过程中候选排序变化的追踪;test字段则可用于自动化验证生成代码的功能正确性。建议在加载后根据task_id与entry_point进行分组管理,以便在多项任务间进行系统性对比实验。
背景与挑战
背景概述
在程序合成与自动化代码生成领域,高质量执行轨迹数据集的匮乏长期制约着模型对代码语义的深层理解。该数据集由匿名研究团队于2024年构建,基于Qwen3-8B模型在trust参数0.75与学习率0.0001下经强化学习采样生成,包含142条训练样本,每条样本涵盖任务标识、入口函数、自然语言提示、补全代码、top-k概率演进步伐及测试用例,旨在捕捉代码生成过程中的动态决策模式。其核心研究问题在于探索如何利用概率演化信号提升模型对代码正确性的自我验证能力,为程序合成领域提供了细粒度的过程性监督资源,对代码大模型的训练范式具有潜在影响。
当前挑战
该数据集所应对的领域问题在于代码生成模型缺乏对中间推理步骤的显式建模,难以在复杂编程任务中保持逻辑连贯性与语义正确性。构建过程中面临多重挑战:采样策略需在探索与利用间取得平衡,以确保top-k概率轨迹既具多样性又不失代表性;仅142条样本的规模限制了统计稳健性与泛化能力,可能引入采样偏差;测试用例的覆盖范围与难度分布未加标注,难以评估模型在边界条件下的表现;此外,将概率演进步伐与代码补全对齐需要精细的工程处理,以保障数据质量与可复现性。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术前沿中,该数据集通常被用于训练和评估大语言模型根据自然语言描述生成可执行代码的能力。其经典使用场景聚焦于代码补全与函数级生成任务,研究者利用其中142个训练样本的提示与完成对,驱动模型学习从问题陈述到代码实现的映射关系,并借助top_k_progression字段追踪生成过程中候选代码的演化轨迹。这一设定使得该数据集成为衡量模型在有限样本下代码生成质量与稳定性的理想试验台。
衍生相关工作
围绕该数据集,后续研究衍生出一系列针对代码生成过程分析与小样本微调策略的经典工作。部分工作聚焦于利用top_k_progression进行生成轨迹的可视化与诊断,另一些则探索基于该数据集训练轻量化模型以适配边缘设备上的代码补全需求。这些工作共同推动了程序合成领域从单一精度评价向过程透明化与资源高效化方向的演进。
数据集最近研究
最新研究方向
面向代码生成的大语言模型自回归训练与推理优化已成为当前程序合成领域的焦点议题。该数据集以Qwen3-8B为基座模型,围绕142个代码任务构建了包含提示、补全、top-k概率演进及测试用例的细粒度轨迹记录,其命名中的autophagycode、trust与温度参数等元信息暗示了在训练稳定性与解码多样性之间的权衡探索。前沿研究正借助此类数据剖析模型在代码生成中的不确定性传播机制,并结合强化学习与信任域约束提升生成代码的可执行性与正确率。该数据集为理解大模型代码推理的动态过程、评估解码策略对程序语义保真度的影响提供了实证基础,对推动可信代码智能与自动化软件开发具有积极意义。
以上内容由遇见数据集搜集并总结生成



