遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g9_run0

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含142个训练示例,主要用于代码生成或任务完成相关任务。每个示例包含以下特征:任务ID(task_id)、入口点(entry_point)、提示(prompt)、完成内容(completion)、top_k进展(top_k_progression)和测试信息(test)。数据集以训练分割为主,总大小约为5.2MB,下载大小约为1.27MB。

This dataset contains 142 training examples, primarily designed for code generation or task completion tasks. Each example includes the following features: task_id, entry_point, prompt, completion, top_k_progression, and test. The dataset is focused on the train split, with a total size of approximately 5.2MB and a download size of about 1.27MB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g9_run0 数据集图片
构建方式
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g9_run0,是一个面向代码生成与自动编程任务构建的专业数据集。其构建过程依托Qwen3-4B基础模型,采用特定学习率0.0001进行微调训练,共包含142个高质量训练样本。每个样本结构精细,涵盖任务标识符、函数入口点、输入提示、补全结果、top-k进展序列以及测试用例等字段,确保数据在编程任务中的完整性与可复现性。数据集以默认配置存储,训练数据统一存放于data/train-*目录,便于高效加载与使用。
特点
该数据集的核心特点体现在其结构化程度与专业性。每个样本均包含task_id与entry_point字段,便于任务定位与函数调取;prompt与completion构成典型的代码补全对,适合训练序列生成模型。尤为突出的是top_k_progression字段,记录了模型在生成过程中top-k候选结果的动态演化,为研究模型推理路径与生成稳定性提供了独特视角。此外,test字段保留验证用例,支持对生成代码正确性的自动化评估。整个数据集规模小巧精致,专为信任系数1.1、生成轮次9次的特定实验场景设计。
使用方法
对于该数据集的使用,建议将其加载为训练集进行监督微调。用户可通过HuggingFace datasets库直接读取默认配置下的train分片数据,利用prompt字段作为输入、completion字段作为监督目标,训练代码生成模型。top_k_progression字段可辅助分析模型在生成过程中的置信度变化或进行对比学习探索。test字段中的测试用例可用于评估模型生成代码的功能正确性。由于数据集仅包含142个示例,适合在特定领域或少量样本场景下进行快速实验验证或模型行为分析。
背景与挑战
背景概述
该数据集由AutophagyCode研究团队构建,旨在为代码生成领域的模型微调提供高质量的训练样本。数据集基于Qwen3-4B模型,在特定学习率(0.0001)和信任阈值(1.1)等参数下生成,包含142个训练样本,聚焦于自噬相关代码任务的自动补全与生成。数据集创建于2025年,其核心研究问题在于探索如何在有限样本条件下提升小型语言模型在代码生成任务中的性能,尤其是在生物信息学与自噬研究交叉领域的应用。该数据集不仅为代码智能领域提供了针对特定生物学任务的微调基准,也推动了小型模型在专业领域代码生成中的实用化进程。
当前挑战
该数据集所解决的领域挑战在于:当前代码生成模型多针对通用编程任务,缺乏对生物学特定领域(如自噬相关代码)的支持,导致模型在专业任务上生成质量低下。构建过程中面临的主要挑战包括:首先,由于自噬研究领域的数据稀缺,高质量代码样本难以获取,仅有142个样本可用,样本量极小;其次,模型在有限样本下的过拟合风险高,需要精细调整超参数(如学习率、信任阈值)以平衡生成准确性与泛化能力;最后,代码任务验证困难,缺乏自动化测试套件(test字段为空),需人工评估生成代码的生物功能正确性,极大增加了构建成本与复杂度。
常用场景
经典使用场景
该数据集专注于代码自动补全任务,尤其在自噬相关基因(autophagy-related genes)的编程研究领域具有独到价值。数据集包含142个训练样本,每个样本由任务标识、函数入口点、提示文本、代码补全结果、Top-K进展序列及测试用例构成,为科研人员提供了高质量、结构化的代码生成训练语料。其经典使用场景是作为微调Qwen3-4B等中型语言模型的监督数据,使模型能够精准理解生物学领域的编程规范,生成符合特定科学计算需求的代码片段,从而在生物信息学与自然语言处理交叉研究中搭建起桥梁。
实际应用
在实际应用中,该数据集可直接赋能计算生物学实验平台,助力研究人员快速生成自噬基因分析脚本。例如,在药物筛选或基因表达量计算场景下,科研人员输入简洁的任务描述,模型即可基于该数据集的学习经验,自动补全出经测试用例验证的Python或R代码。这极大缩短了从实验设计到数据分析的周期,同时减少因手工编写错误导致的实验重复,使得非计算机背景的生命科学工作者也能高效利用复杂算法工具。
衍生相关工作
该数据集衍生的经典工作主要集中在对代码生成模型的信任机制改进、领域自适应微调策略以及编码知识蒸馏方法。典型代表包括基于该数据训练得到的‘可信代码助手’,其引入的Top-K进展序列监控功能被后续研究采纳,用于实时评估代码生成质量。此外,该数据的高质量标注格式启发了针对生物信息学代码补全的数据增强与少样本学习工作,推动了专业领域模型从通用代码生成向精细调控的演进,并催生了若干结合基因本体论的代码语义对齐框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务