遇见数据集

autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t0.2_g4

收藏
Hugging Face2026-04-27 更新2026-04-28 收录
官方服务:

资源简介:

该数据集包含142个训练样本,每个样本包含6个结构化字段:任务ID(task_id)、入口点(entry_point)、提示文本(prompt)、补全内容(completion)、top_k进度(top_k_progression)和测试内容(test)。数据集总大小为5.8MB,下载文件体积为572KB。从字段命名推测可能用于代码生成或文本补全类任务,但README未提供明确的任务定义或数据来源说明。

This dataset contains 142 training samples, each with 6 structured fields: task_id, entry_point, prompt, completion, top_k_progression, and test. The total size of the dataset is 5.8 MB, and the compressed download file size is 572 KB. Based on the field naming, it can be inferred that the dataset may be used for code generation or text completion tasks, but no explicit task definition or data source description is provided in the README.

创建时间:
2026-04-21
原始信息汇总

根据您提供的数据集详情页面信息,以下是对该数据集的关键内容总结:

数据集概述

数据集名称:autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t0.2_g4

来源地址:https://huggingface.co/datasets/stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t0.2_g4

数据特征

该数据集包含以下6个字段:

  • task_id:字符串类型,表示任务ID
  • entry_point:字符串类型,表示入口点
  • prompt:字符串类型,表示提示内容
  • completion:字符串类型,表示完成内容
  • top_k_progression:字符串类型,表示Top-K进度
  • test:字符串类型,表示测试数据

数据集划分

数据集仅包含一个划分:

  • 训练集(train):包含142个样本,占用约5.82 MB(5,823,887字节)

数据集大小

  • 下载大小:约572,789字节(约0.55 MB)
  • 总数据集大小:约5,823,887字节(约5.82 MB)

配置文件

  • 默认配置(default):包含训练集数据文件,路径为 data/train-*
搜集汇总
数据集介绍
autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t0.2_g4 数据集图片
构建方式
该数据集以自噬相关基因为背景,选取汞离子(mercury)作为环境胁迫因子,依托Qwen3-4B大语言模型进行指令微调。构建过程中设定学习率为0.0001,训练轮次为142,采用信任阈值0.2与生成数量4的策略,通过top-k渐进式生成方法获取模型对特定编程任务的代码补全结果,最终整合为包含任务标识、入口函数、提示词、补全内容及测试用例的结构化数据。
特点
数据集聚焦于汞胁迫下自噬基因相关编程任务的代码生成能力评估,包含142个训练样本,每个样本涵盖任务标识、入口点、提示词、补全文本和测试用例五大字段。其独特之处在于结合了生物学背景与代码补全任务,并通过top-k渐进式生成方法记录模型推理路径,为分析大模型在特定领域代码生成中的性能与可靠性提供了细粒度数据支撑。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,默认配置为'train'分割,包含全部142条样本。每条数据中的'prompt'字段可作为输入,用于测试模型对自噬相关编程问题的理解与补全能力;'completion'字段为参考输出,'test'字段提供验证用例。数据可直接用于大语言模型的fine-tuning或zero-shot评估,尤其适用于探究模型在低资源、高领域特异性场景下的代码生成表现。
背景与挑战
背景概述
该数据集由Qwen团队基于Qwen3-4B模型在代码生成任务中构建,创建于近期,旨在探究大型语言模型在自监督学习框架下的推理能力演化。核心研究问题聚焦于模型在生成代码时,如何通过逐级递进的top-k策略提升输出质量与可靠性,并量化信任度阈值(trust_t0.2)对生成轨迹的影响。数据集包含142个训练样本,覆盖多元编程任务,其贡献在于为理解大语言模型内部知识表征与渐进式推理机制提供了微观视角,在代码智能与可解释AI领域具有开拓性意义。
当前挑战
当前挑战涵盖两个层面:领域问题层面,需解决大语言模型在代码生成中普遍存在的逻辑偏差与幻觉现象,尤其是当模型输出在低置信度区间(如trust_t0.2)时,如何维持语义正确性与语法合规性。构建过程层面,面临样本规模有限(仅142例)导致模型泛化能力不足的瓶颈,以及多级top-k序列标注中人工标注成本高、一致性维护难的问题。此外,动态追踪模型在自回归生成时的内部状态变化,对计算资源与架构设计提出严苛要求,阻碍了大规模部署与实时推理的实现。
常用场景
经典使用场景
在自然语言处理与代码智能的交叉领域中,autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t0.2_g4数据集以其精细的代码补全任务设计而独树一帜。该数据集专为训练和评估大型语言模型在代码生成场景下的能力而构建,尤其聚焦于基于信任阈值的渐进式代码补全机制。每一条样本都包含任务标识、函数入口点、提示文本、模型生成的补全内容、逐步推理过程以及标准测试用例,共同构成一个完整的代码生成闭环。研究者可借助该数据集检验模型在理解程序语义、生成符合语法规范的功能代码、以及在多步推理中保持逻辑一致性方面的表现,是探索代码智能体行为与信任校准机制的理想基准。
解决学术问题
该数据集旨在解决代码生成领域中一个长期存在的核心学术难题——如何量化并提升语言模型在代码补全任务中的可靠性与渐进推理能力。传统评估往往只关注最终生成代码的功能正确性,而忽视了模型在逐步推理过程中可能暴露的逻辑断裂或偏离。通过引入‘渐进式推理路径’与‘信任阈值’两项关键设计,该数据集能够揭示模型在生成每一步代码时的置信度变化与选择偏好,为研究代码生成的中间状态、模型不确定性与错误传播机制提供了前所未有的实验素材。它不仅推动了代码智能体可解释性研究的进展,还为构建更鲁棒、更可信的代码生成系统奠定了数据基础。
衍生相关工作
围绕该数据集的设计理念,学术界已衍生出一系列相关研究工作。其中最具代表性的包括基于渐进式信任校准机制的代码生成模型优化方法,以及利用多步骤推理路径进行模型不确定性量化的评估框架。受其启发,研究者进一步提出了信任感知的代码补全损失函数设计,在模型训练阶段即引入对推理过程置信度的约束,显著提升了生成代码的功能正确性与结构一致性。此外,该数据集所定义的‘渐进式推理’评价范式,已被扩展至涉及多函数交互、跨模块调用等更复杂的程序合成任务中,催生了新一波关于代码智能体内部状态建模与输出可追溯性分析的研究浪潮。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务