stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3228567 num_examples: 164 download_size: 833019 dataset_size: 3228567 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集基于自噬代码领域的编程问题,通过引入Qwen3-4B模型作为生成引擎,结合信任导向的策略(trust strategy)进行构建。采用温度参数t=1.25与生成数量g=9的设置,从同一指令中采样多样化的代码补全结果。数据集中每个样本包含任务标识、入口函数、原始提示、补全结果、top_k进展序列以及测试用例,旨在为编程任务提供结构化的训练数据。
特点
数据集包含164个训练样本,涵盖明确的task_id与entry_point标识,便于追踪与复用。每个样本同时提供prompt与completion对,以及top_k_progression字段记录生成过程中的逐步进展,有助于分析模型推理路径。测试用例字段(test)支持对补全结果进行自动化评估,整体结构清晰,适合用于代码生成与自噬机制相关的研究。
使用方法
数据集以HuggingFace格式托管,通过默认配置加载train分片数据。用户可直接调用datasets库读取data/train-*文件,获取task_id、prompt、completion等字段进行模型微调或评估。建议将prompt作为输入、completion作为目标进行监督学习,并利用test字段对生成代码进行功能性验证。
背景与挑战
背景概述
该数据集由Qwen团队基于Qwen3-4B模型构建,旨在探索代码生成任务中的信任校准与策略优化问题。创建于2025年,核心研究聚焦于通过自噬机制(autophagy)筛选高信任度的代码补全方案,以提升大语言模型在编程辅助中的可靠性。包含164条训练样本,每条样本涵盖任务标识、函数入口、提示词、补全代码及信任度演进路径,为代码生成的置信度评估与策略调整提供了基准。尽管规模有限,但其对模型生成代码的信任机制研究具有开创性意义,推动了自监督学习与代码智能的交叉发展。
当前挑战
当前面临的核心挑战在于:1)代码生成领域普遍存在的‘假阳性’信任问题,即模型给出高置信度但实际错误的补全,该数据集通过信任度曲线(top_k_progression)追踪解决此问题的动态机制;2)构建过程中需在有限训练样本(164条)上平衡多样性,确保覆盖从简单语法到复杂逻辑的代码场景,同时避免因小样本导致过拟合或泛化不足,这对数据筛选策略的鲁棒性提出极高要求。
常用场景
经典使用场景
该数据集专为代码生成与推理任务而设计,聚焦于通过监督微调提升语言模型在编程竞赛类问题上的表现。其核心使用场景是作为训练语料,驱动如Qwen3-4B等中小规模模型在代码补全、函数实现及算法题解等方向上的能力进化。数据集中每条样本包含任务标识、函数入口点、问题描述提示、目标补全代码及测试用例,形成了一套完整的“问题—解答—验证”闭环,非常适合用于构建和评估模型在结构化编程任务中的准确性与鲁棒性。
解决学术问题
该数据集主要回应了代码智能领域中模型对复杂逻辑理解与生成能力不足的挑战。通过提供高质量、带有严格测试验证的编程问题样本,它帮助研究者探索如何利用少量但精良的微调数据激发模型的推理潜能,解决了传统大规模语料中噪声多、目标模糊的问题。其意义在于为代码生成任务的信任度与安全性研究提供了基准,推动了可解释、可验证的代码合成模型的发展,对提升学术研究中模型评估的公平性与可复现性具有深远影响。
衍生相关工作
围绕该数据集的特性,衍生出若干关键研究方向。其中,基于策略梯度的代码生成信任校准工作(如trust策略中的温度采样t=1.25与top-k渐进式生成)为后续探索模型生成置信度与代码质量之间的关系奠定了基础。此外,针对类似数据集(如APPS、HumanEval)的对比分析,以及多模型(如Mercury系列)在相同策略下的表现评测,已成为验证不同强化学习与微调方法有效性的经典实验范式。
以上内容由遇见数据集搜集并总结生成



