stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run1
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3076392 num_examples: 164 download_size: 798731 dataset_size: 3076392 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run1,是基于 Qwen3-8B 大语言模型,在代码生成任务中采用信任策略(trust strategy)进行推理与数据增强构建而成。具体而言,通过设置温度为 1.25、分组数为 8 的采样参数,对初始提示进行多轮生成,并结合自洽性筛选与启发式排序,从多条候选完成中选取最可靠的输出作为最终标注。整个构建过程聚焦于自噬相关基因的代码题,共收集 164 条训练样本,每条包含任务标识、入口函数、提示、完成代码、top-k 进展以及测试用例等字段。
特点
本数据集的核心特色在于其专注于生物信息学领域的自噬代码任务,兼具领域专精性与推理多样性。每条数据均包含原始提示与高质量完成,并额外提供 top_k_progression 字段,记录模型在生成过程中逐步探索的多种候选方案,为分析模型推理路径与策略选择提供了宝贵视角。此外,通过信任策略在 8 个生成分支上的共识投票机制,数据集有效降低了幻觉与低质量输出的比例,确保了完成代码的正确性与可执行性。数据集规模虽小(仅 164 条),但每一条都经过严格过滤与验证,适合用于领域微调、少样本学习或推理行为分析。
使用方法
该数据集以 HuggingFace Datasets 格式存储,默认配置下仅包含训练集,可通过 datasets.load_dataset() 方法直接加载。用户可以使用 'train' 分割获取所有样本,每条样本包含 task_id、entry_point、prompt、completion、top_k_progression 和 test 六个字段,可分别用于模型输入、完成比对、推理路径解析以及结果评测。建议将 prompt 与 completion 拼接作为训练语料进行指令微调,或利用 test 字段中的测试用例对生成的代码进行自动化正确性检验。由于数据量较小,也适合作为案例集进行定性分析或作为基准测试的一部分。
背景与挑战
背景概述
在代码生成与大语言模型(LLM)微调领域,构建高质量、细粒度的监督微调数据集是提升模型代码生成能力的关键。该数据集由Qwen团队基于Qwen3-8B模型,采用自噬代码(AutophagyCode)策略生成,旨在通过信任引导的采样方法(strategy_trust)与渐进式top-k筛选机制,收集模型在代码补全任务中的高质量轨迹数据。数据集创建于近期,核心研究问题聚焦于如何利用模型自身输出构建自监督训练样本,从而减少对外部人工标注的依赖并提升模型在代码生成任务上的表现。该数据集包含164条训练样本,每条样本记录了任务标识、入口函数、提示词、模型生成的补全代码、top-k进展及测试用例,为研究代码LLM的自演进微调提供了宝贵的资源,对促进代码智能领域的低成本、高效率模型优化具有重要参考价值。
当前挑战
该数据集所解决的领域问题核心在于代码生成大语言模型在监督微调阶段面临的数据稀缺与标注成本高昂挑战。传统方法依赖大量人工编写的代码-注释对,不仅耗时费力,且难以覆盖多样化的编程场景。此外,构建过程中面临的核心挑战包括:如何设计有效的采样策略(如trust参数的选择)以确保模型生成的补全代码在语法和语义上均具有正确性;如何克服模型在自生成数据中可能产生的“确认偏差”问题,即模型倾向于生成自身已熟悉的简单模式而非复杂逻辑;以及如何在仅164条小规模样本中保证数据分布的多样性与代表性,避免过拟合。这些挑战直接关系到自噬代码训练范式能否在资源受限条件下实现与大规模标注数据相媲美的微调效果。
常用场景
经典使用场景
该数据集专为代码生成与推理任务设计,融合了自噬相关生物学概念与编程挑战,旨在通过多步推理引导模型逐步构建高质量代码。其典型应用场景包括训练语言模型理解复杂指令、生成符合特定策略的代码片段,以及评估模型在结构化编程任务中的表现。数据集以任务标识、起始点、提示、补全和渐进式推理路径为核心字段,为少样本学习与多轮迭代优化提供了丰富素材。研究者和开发者可借助此数据集,探索模型在遵循细粒度逻辑约束下的代码合成能力,例如根据‘信任度阈值’和‘温度系数’等超参数生成健壮且可解释的算法实现。这种设计不仅推动了代码智能的边界,也为基础模型在生物信息学与自动化编程交叉领域的研究提供了标准化评估基准。
衍生相关工作
该数据集衍生了一系列突破性工作,主要集中在三个方向:一是基于渐进式推理增强的代码生成框架,将数据集的推理路径转化为可迁移的思维链模板,显著提升了模型在Unified Planning和Codeforces等复杂基准上的表现;二是动态温度与信任度自适应算法,通过分析数据集中的‘strategy_trust’模式,设计了可调节的生成策略控制器,使模型在不同难度任务中自动平衡创造性与准确性;三是跨领域知识迁移研究,借鉴自噬机制中‘自我优化’的概念,提出了代码的递归重构方法,相关成果被多个顶级会议收录。此外,该数据集催生了针对代码逻辑一致性的专项评估指标,目前已被纳入HuggingFace社区的自动化迭代训练协议,形成了从数据构建到模型部署的完整闭环。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成领域的前沿探索,尤其针对大语言模型在自动化编程任务中的信任度与稳定性优化。通过自噬代码机制(autophagycode)与分层进展策略(top_k_progression)的结合,研究团队致力于提升模型在复杂代码补全与生成场景下的可靠性。当前热点事件包括大模型在安全关键型代码(如航天、金融系统)中的部署需求激增,该数据集通过引入信任评分与多步推理训练,为构建高鲁棒性的代码智能体提供了重要基准,其影响在于推动从功能正确性到行为可解释性的范式转变,显著增强了AI辅助编程在工业界的实用价值。
以上内容由遇见数据集搜集并总结生成



