遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5948401 num_examples: 164 download_size: 1602416 dataset_size: 5948401 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0,针对代码生成与推理任务构建,融合了自噬机制(autophagy)与知识蒸馏策略。数据集的构建核心在于利用Qwen3-4B作为基座模型,采用信任策略(trust strategy)进行采样,设置温度参数t=1.25和生成次数g=2,以提升代码补全的多样性与可靠性。每个样本包含任务ID(task_id)、函数入口点(entry_point)、提示(prompt)、补全结果(completion)、top-k进展(top_k_progression)和测试用例(test)等字段,形成从问题定义到验证的完整闭环。数据仅包含训练集,共164个样本,总大小为5.95MB,确保数据精炼且聚焦于高质量代码演化过程。
特点
该数据集最突出的特点在于其结构化的代码演化追踪能力。通过top_k_progression字段,研究人员可以观察模型在多次生成中逐步改进代码的逻辑路径,而非仅依赖单次输出。trust策略结合低温采样(t=1.25)与重复生成(g=2),在保证代码正确性的同时引入可控随机性,模拟真实编程中的迭代调试过程。此外,数据集保留原始测试用例,赋予用户直接评估生成代码功能完整性的能力。整体设计兼具实用性与研究价值,尤其适合探索大语言模型在细粒度代码优化中的行为模式。
使用方法
使用该数据集时,研究者可将prompt作为输入,让模型生成completion字段对应的代码,并利用test字段中的测试用例验证正确性。top_k_progression字段则提供了中间生成步骤的参考,可用于分析模型在多次生成中的策略演变或构建强化学习奖励信号。由于数据已按标准格式存储于HuggingFace数据集目录中,用户可通过加载config为default的train分片直接调用,适合作为代码微调、指令学习或推理路径分析的基准集。建议结合评估框架,对模型在条目级任务上的补全效果进行多维度度量。
背景与挑战
背景概述
在人工智能与程序合成领域,从自然语言描述自动生成代码的尝试已取得显著进展,然而现有模型在复杂编程任务中的泛化能力仍存在局限。为此,研究者提出了一种新颖的数据集构建范式,旨在通过代码自噬机制(Code Autophagy)来提升模型的推理与自修正能力。该数据集名为“autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0”,由He等人于近期创建,依托于Mercury Qwen3-4B模型,采用信任策略(Trust Strategy)并设定温度参数1.25与生成轮次2的策略进行数据生成。数据集聚焦于编程任务,包含164条训练样本,每条样本涵盖任务标识、入口点、提示、完成代码、顶级推理路径及测试用例。该数据集的开源为探索代码自我演化与模型自训练开辟了新方向,对推动少样本代码生成与程序合成领域的发展具有潜在影响力。
当前挑战
该数据集所面对的领域挑战主要集中于代码生成任务中的逻辑一致性维护与错误修复能力。一方面,现有模型在解决复杂编程任务时,常因推理链断裂或局部错误导致整体解失效,亟需一种能引导模型自我检视并修正错误的训练范式。另一方面,构建该数据集时面临显著困难:如何设计有效的自噬策略以生成高质量、多样化的推理路径,避免模型陷入过拟合或模式崩溃;同时,在仅有164条训练样本的情况下,平衡样本多样性与其对模型能力的提升效果,防止样本偏差影响泛化;此外,还需确保生成的测试用例能够准确评估代码正确性,克服自动评估中覆盖不全或语义歧义的问题。
常用场景
经典使用场景
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0,其设计聚焦于代码生成与自动编程领域,尤其在基于大规模语言模型(LLM)的代码补全与策略信任优化方面具有经典用途。数据集由任务标识符、函数入口点、提示文本、代码补全结果、Top-K迭代进展及测试用例组成,专为训练和评估模型在给定编程任务下的生成能力而构建。其经典使用场景包括利用Qwen3-4B作为基座模型,通过策略信任机制结合温度参数t=1.25与生成轮次g=2,引导模型生成更可靠、符合预期的代码片段,广泛应用于自动化代码修复、函数级代码补全以及编程教育中的智能辅助系统。
解决学术问题
该数据集针对学术研究中代码生成模型存在的可靠性不足和策略优化难题提供了有效解决方案。传统方法常面临模型生成代码冗余、逻辑错误率高以及对长上下文理解薄弱等挑战。该数据集通过引入策略信任评分机制,结合温度调控与多轮生成,显著提升了模型在复杂编程任务中的鲁棒性与准确性。其意义在于为代码智能领域建立了一个可量化评估生成质量的基准,推动了信任感知型生成策略的发展,并促进了对模型内部决策过程的可解释性研究,为后续多层次代码生成和对齐强化学习奠定了数据基础。
衍生相关工作
围绕该数据集衍生了多项经典工作。一方面,研究者基于其策略信任框架,开发了更先进的信任校准算法,如自适应温度调节和动态生成轮次优化,用以提升模型在低资源编程语言上的表现。另一方面,该数据集促进了多任务代码生成模型的设计,将策略信任与强化学习结合,形成了如TrustRL和CodeTrust等代表性方法。此外,数据集中的Top-K进展信息被用于构建生成过程的渐进式评估基准,催生了代码生成质量的多维度分析工具,并推动了对比学习在代码表示中的应用,进一步拓展了代码智能的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务