遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 4392081 num_examples: 164 download_size: 1071364 dataset_size: 4392081 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0,源自自噬生物学领域的代码生成任务。构建方式基于大规模语言模型Qwen3-4B,采用名为'mercury'的推理策略,结合信任度阈值(t1.1)与7次生成轮次(g7),针对'自噬代码'(autophagycode)这一特定领域中的D_he任务进行数据生成。数据集包含164条训练样本,每条样本由任务ID(task_id)、函数入口点(entry_point)、提示词(prompt)、补全代码(completion)、Top-K演进序列(top_k_progression)以及测试用例(test)构成,形成结构化的代码生成与评估框架。
特点
该数据集的核心特点在于其高度专业化的领域聚焦与多维度结构设计。所有样本均围绕自噬生物信息学中的D_he代码生成任务,反映了生物学计算中的特定问题。特征中引入'top_k_progression'字段,记录了模型在生成过程中的逐步推理路径,为分析模型策略提供了可追溯的中间状态。此外,每条样本均附带独立的测试用例(test),允许对生成的代码进行自动化功能验证,提升了数据集的实用性与可复现性。数据集规模紧凑(164条),但覆盖了从提示到验证的完整流程,适合用于微调与评估领域专用代码模型。
使用方法
使用该数据集时,用户可通过加载'default'配置下的'train'分割,直接获取全部164条样本。每个样本的'prompt'字段可作为输入,驱动模型生成对应的'completion'代码。生成的代码可利用'test'字段提供的测试用例进行正确性验证,而'top_k_progression'可用于分析模型的中间推理步骤。该数据集适用于代码生成模型的监督微调、策略对比实验以及生物信息学领域自动化代码合成的基准测试。建议结合Python环境与标准数据处理库(如datasets库)进行读取与迭代训练。
背景与挑战
背景概述
在代码生成与程序合成领域,大语言模型(LLMs)的推理能力与可解释性仍是关键瓶颈。autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0数据集由自噬码(autophagycode)团队于2024年创建,以Qwen3-4B为基座模型,聚焦于通过信任策略(strategy_trust)与温度采样(t1.1)生成多路径(g7)的代码补全序列。该数据集包含164条训练样本,每条样本涵盖任务标识、函数入口、提示、补全内容、top-k推理路径及测试用例,旨在促进模型在复杂编程任务中生成可信、可跟踪的代码演化。其研究问题直指如何将语言模型的生成过程从黑盒逼近转向可解释的逐步推理,对推动代码智能体与自动化程序合成领域具有示范价值。
当前挑战
该数据集面临的核心挑战包括:首先,领域问题层面,现有代码生成模型常因推理链不可信而导致功能错误或安全漏洞,该数据集需解决如何通过少量示例(164条)引导模型在有限资源下生成逻辑一致、语法完备的代码补全,同时保持对多路径探索的合理约束。其次,构建过程中的挑战在于:设计trust策略(如t1.1温度)与group数量(g7)的最优组合,以平衡生成多样性与可重复性;确保top_k_progression字段中推理路径的语义连贯性,避免因采样噪声导致路径分裂;以及构造覆盖典型编程陷阱(如边缘逻辑、异常处理)的测试用例,以验证补全的鲁棒性。这些挑战共同决定了数据集在指导模型对齐与评估中的实际效用。
常用场景
经典使用场景
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0,其结构涵盖任务标识(task_id)、函数入口点(entry_point)、提示词(prompt)、补全结果(completion)、逐步进展(top_k_progression)及测试数据(test)。在代码生成与推理领域,经典使用场景聚焦于大型语言模型的指令微调与策略优化。研究人员常利用该数据集训练模型,使其在给定编程问题提示后,能够输出高质量、结构化的代码补全结果。164个训练样本虽规模精炼,但通过逐步进展字段的引导,可有效提升模型在复杂编程任务中的推演准确率与代码鲁棒性。
解决学术问题
该数据集所解决的学术问题主要包括代码生成中的策略对齐与信任校准。传统模型在生成代码时,常面临逻辑偏离、步骤跳跃或语义误解等困境。通过引入逐步进展(top_k_progression)这一结构化监督信号,数据集促使学术界探索如何在有限样本约束下提升模型对复杂编程逻辑的分解与递进能力。其意义在于为代码语言模型的信任度建模提供了可行性路径,即通过细粒度的推理步骤监督,缓解了大规模预训练模型在代码生成中的幻觉与不一致性问题。研究影响辐射至程序合成、自动调试及教育编程辅助等多个学术分支。
衍生相关工作
该数据集衍生的相关工作主要集中于策略微调与信任增强机制的探索。例如,研究人员可基于其逐步进展标注,提出“逐步信任蒸馏”方法,以提升较小规模模型(如Qwen3-4B)在代码任务上的准确率。此外,与“逐步推理”相关的对比学习范式、基于top_k筛选的注意力掩码优化策略等,均可视为该数据集的衍生成果。这些工作不仅推动了代码智能生成算法的精进,也为后续研究如多步推理验证、自洽性校准等方向奠定了数据基础,形成了从监督信号设计到模型可信度评估的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务