遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run0

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务,每个任务包括任务ID、入口点、提示(prompt)、完成代码(completion)、top-k进展(top_k_progression)和测试用例(test)。训练集包含142个样本。

This dataset contains programming tasks, each with a task ID, entry point, prompt, completion code, top-k progression, and test cases. The training split contains 142 samples.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run0 数据集图片
构建方式
该数据集基于自噬机制与细胞生物学知识背景,结合Qwen3-4B语言模型进行构建。其构建过程以低学习率(lr=0.0001)微调策略为核心,通过对142个样本进行信任度校准(trust_t1.1)与生成轮次控制(g3),以生成高质量的代码补全与推理结果。数据集中包含任务标识、入口函数、提示词、完成代码、top-k推理过程及测试用例等字段,形成了结构化的监督学习样本集。
特点
数据集的核心特点在于其聚焦于自噬相关代码任务的生成与评估,结合了top-k推理路径的显式记录(top_k_progression),能够揭示模型逐步生成代码的逻辑过程。同时,通过信任度参数(t1.1)与生成轮次限制(g3)的设定,数据集在有限样本量(142条)下实现了对模型生成稳定性与可靠性的精细控制,适用于分析低资源场景下代码生成的推理行为。
使用方法
数据集以HuggingFace Datasets格式存储,包含单一的训练集划分(train),共计142条样本。用户可通过指定default配置加载数据,每条样本包含文本型字段(如prompt、completion)和结构型字段(如test),适合用于监督微调、推理路径分析或代码生成评估任务。加载后可利用standard Python接口进行字段提取、批处理或模型输入封装,适用于代码智能领域的模型训练与基准测试。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run0,由autophagycode团队创建,聚焦于代码生成任务的自我改进与信任机制研究。数据集包含142个训练样本,每个样本包含任务ID、函数入口点、提示词、完成代码、前k个进展序列及测试用例。其核心研究问题在于探索如何利用小型语言模型(如Qwen3-4B)通过低学习率微调(lr0.0001)和信任阈值调参(t1.1)实现代码生成的可靠性与迭代优化。该数据集在代码智能领域具有独特价值,为细粒度评估模型的自改进能力提供了基准。
当前挑战
本数据集所解决的领域挑战包括:代码生成任务中模型输出可靠性的量化评估,尤其是如何结合信任机制与多步推理来抑制错误代码的产生。在构建过程中面临多重困难:样本数量有限(仅142例),需在低数据量下设计有效的学习率与信任参数协同策略;同时,top_k_progression字段的引入要求对模型内部前k个候选方案进行动态追踪,增加了标注与验证的复杂度。此外,确保测试用例能覆盖边界条件以避免过拟合于少数样本,也是构建时需谨慎平衡的难题。
常用场景
经典使用场景
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g3_run0,其名称暗示了与代码生成、自噬相关生物信息学或特定模型微调之间的潜在关联。在自然语言处理与生物医学交叉领域,该数据集最典型的用法是针对自噬过程相关基因、蛋白质或功能模块的代码级描述进行生成与补全。研究者可利用其中的task_id、entry_point、prompt与completion字段构建序列到序列的学习任务,训练轻量级语言模型(如Qwen3-4B)在给定生物上下文提示下生成符合语法规范的功能性代码片段。这一场景契合了将领域知识嵌入预训练模型,实现从自然语言到可执行代码的精准映射。
衍生相关工作
该数据集作为特定领域内的代码生成微调资源,启发了多项衍生性经典工作。其一,研究者以该数据集为起点,结合指令微调范式探索了自噬相关基因列表到自动化实验流程配置文件的映射,催生了领域专用代码生成工具的开发。其二,基于其c142样本规模,衍生出关于低资源场景下大语言模型微调策略的对比研究,包括对学习率、信任阈值和梯度累积步数等超参数的系统性分析。其三,该数据集被扩展为多语言代码生成基准的一部分,用于评估模型在跨语言生物注释与代码间的零样本迁移能力。这些工作共同推动了生物大模型在垂直科研任务中的落地应用,并形成了以生物代码生成为核心的新型研究方向。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成与自动化编程领域,特别关注基于大语言模型的指令微调与推理优化。通过整合任务标识、入口点、提示与补全等结构化特征,数据集为探究模型在复杂编程任务中的少样本学习与渐进式推理能力提供了基础。当前前沿研究方向包括利用该数据集训练更高效的代码生成模型,探索拓扑结构对推理路径的影响,以及提升模型在信任度校准下的鲁棒性。这一工作与近期大语言模型在软件开发自动化、低代码平台及智能编程助手等热点事件紧密相连,对于推动代码智能的实用化、降低编程门槛具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务