遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 6759327 num_examples: 164 download_size: 1544704 dataset_size: 6759327 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1,源自自噬代码领域,旨在为代码生成任务提供高质量训练样本。在构建过程中,数据集采用了对模型生成策略进行精细调控的方法,通过设定信任阈值t1.1与生成轮次g2,从Qwen3-4B模型在mercury平台上的推理输出中筛选出可靠代码片段。每条样本包含任务标识、函数入口点、提示词、完整补全内容、最优进展路径及测试用例,共计164条训练实例。数据以标准化格式存储,便于后续模型微调与评估。
特点
该数据集的核心特点体现在其针对自噬代码领域的专业性与生成策略的可控性。所有样本均围绕特定生物信息学任务设计,强调代码补全的准确性与逻辑自洽性。通过引入trust策略与多轮生成筛选机制,数据集有效降低了无效或错误输出的比例,提升了样本质量。此外,数据结构中专门设置了top_k_progression字段,用于记录生成过程中最优解的演进路径,为研究代码生成的内在推理步骤提供了独特的分析视角。小型化规模(164条)使其适合作为快速迭代验证的基准集合。
使用方法
数据集以HuggingFace标准格式提供,预设了default配置,所有训练数据存放于data/train-*路径下。使用者可直接通过load_dataset函数加载,无需额外处理。各字段均可直接映射至常见的代码生成模型输入输出结构,其中prompt作为输入指令,completion作为目标输出。建议将数据集用于微调轻量级代码生成模型或作为策略蒸馏的验证集,也可结合test字段进行端到端的自动化测试评估。由于数据量较小,适配于资源受限场景或需要快速实验闭环的开发环境。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1,由自噬代码(AutophagyCode)研究团队基于Qwen3-4B模型创建的代码生成训练数据集,创建于2025年。核心研究问题聚焦于通过信任策略(trust strategy)优化代码合成过程,提升模型在复杂编程任务上的表现。数据集包含164个训练样本,涵盖编程任务描述、函数入口点及多步代码生成过程。尽管规模较小,但其聚焦于高质量代码生成的细粒度训练策略,在代码智能领域具有潜在参考价值,尤其为小样本代码学习与信任导向的强化学习提供了实验基础。
当前挑战
该数据集所面对的领域问题挑战在于代码生成任务中模型输出与预期逻辑的严格一致性,要求数据集必须精准刻画多步推理与拓扑结构的不确定性。构建过程中,需要从大规模预训练模型中提取具有信任倾向的生成路径,同时确保每步进展(top_k_progression)的语义正确性与多样性。此外,仅有164个样本的有限规模易导致过拟合风险,需设计高效策略平衡数据质量与泛化能力,且任务特征(task_id)的多样化与测试集的结构化验证也构成技术难点。
常用场景
经典使用场景
该数据集作为大规模语言模型在自动代码生成与修复领域的训练资源,主要应用于监督式微调场景,以提升模型对复杂编程问题的理解与解答能力。其经典使用方式是将‘prompt’字段中的任务描述与‘completion’字段中的目标代码配对,构成一个结构化的编程问答对,训练模型从自然语言需求到可执行代码的转换。由于数据集包含了‘entry_point’和‘test’等关键信息,也可用于评估模型产生的代码在特定函数入口下的正确性。
解决学术问题
该数据集的构建旨在应对当前大语言模型在处理细粒度、多步骤编程任务时存在的推理连贯性不足问题,特别是模型在逐步生成代码时容易偏离初始逻辑的挑战。它通过引入‘top_k_progression’这种渐进式上下文信息,为研究代码生成的逐步推理提供了新的训练范式。这有助于学者深入探索模型如何通过多步推理保持逻辑一致性,并提升在自动化程序修复和功能性代码合成任务上的表现。
衍生相关工作
基于该数据集的设计理念,衍生出一系列关于代码智能的相关研究工作,包括多步推理增强的代码生成模型以及渐进式代码修复框架。研究者们借鉴了‘top_k_progression’结构,将其应用于代码对比学习或强化学习场景,以优化模型对代码序列中隐含逻辑依赖的建模。此外,该数据集也催生了若干针对编程任务的数据增强方法,通过扩展任务模板来提升模型的泛化能力,推动了代码生成领域评测基准的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务