stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run2
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 3443063 num_examples: 164 download_size: 797769 dataset_size: 3443063 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集命名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run2,其构建过程深度融合了自监督学习与代码生成领域的先进理念。具体而言,研究者以Qwen3-8B大语言模型为基础,采用名为‘trust’的策略对模型生成的代码补全进行筛选与精炼,通过设定温度参数t1.25与生成数量g10,在控制生成多样性的同时确保输出质量。数据集共包含164个训练样本,每个样本均被组织为包含任务标识(task_id)、函数入口(entry_point)、提示(prompt)、模型完成内容(completion)、top-k进度(top_k_progression)以及测试用例(test)的多字段结构,从而为后续的代码微调与评估提供了结构化且高质量的监督信号。
特点
本数据集最显著的特点在于其极致的专业性与专注度——所有164条样本均聚焦于代码生成任务,且经过了基于‘trust’策略的信任筛选机制,这赋予数据集在小型化前提下依然具备的高效训练价值。数据集中每条记录均完整保留了从任务提示到模型生成的完整链条,特别是top_k_progression字段的引入,能够捕捉模型在逐步推理过程中的中间状态,为研究代码生成任务的渐进式优化提供了宝贵线索。此外,数据集以紧密耦合的prompt-completion-test三元组构成闭环,确保了训练样本不仅在语法上完整,在功能正确性上也得到了有效验证。
使用方法
使用该数据集时,研究者需首先通过HuggingFace的datasets库加载默认配置,数据以parquet格式存储于data/train-*文件中。每条数据均可直接用于监督式微调,用户可将prompt字段作为输入,completion字段作为目标输出,构建经典的序列到序列训练范式。特别地,top_k_progression字段可用于研究多步生成过程中的策略调整或进行中间状态的可视化分析,而test字段则提供了标准化的评估基准,便于在微调后对模型生成代码的正确性进行自动化验证。数据集的简洁结构使其可无缝集成至transformers等主流框架中,适用于快速原型开发与实验迭代。
背景与挑战
背景概述
在代码生成与推理任务日益复杂的当下,高质量的微调数据集对于提升大型语言模型的指令遵循能力与泛化性能至关重要。该数据集由自噬代码(AutophagyCode)团队构建,于近期发布,依托Qwen3-8B基座模型,采用名为“trust”的特定策略,配合温度参数1.25与生成数量10的配置,旨在通过多轮渐进式生成与筛选,获取高可靠性的代码完成样本。数据集包含164条训练样本,每条数据涵盖任务标识、入口点、提示、完成结果、top-k渐进信息及测试用例,聚焦于评估模型在给定编程问题上的逐步推理与代码生成能力,为代码智能领域的研究提供了精细化微调资源。
当前挑战
该数据集所解决的领域问题在于代码生成任务中模型输出可靠性不足与错误累积的挑战,即如何让模型在复杂逻辑推理中生成可编译、通过测试的正确代码。构建过程中面临的挑战包括:在高温度采样下保持生成代码的语法正确性与语义一致性,通过top-k渐进策略筛选多样且鲁棒的候选解,以及在小规模样本(164条)上有效捕捉任务分布,防止过拟合或覆盖不足。此外,如何设计通用的任务标识和测试用例以评估模型跨代码场景的泛化能力,也是构建中的关键难点。
常用场景
经典使用场景
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run2,其命名暗示了数据来源于自噬(autophagy)相关领域的代码任务,并基于Qwen3-8B模型通过信任策略(trust strategy)生成,温度参数为1.25,采样步数为10。该数据集专为生物信息学与自然语言处理的交叉领域设计,经典使用场景包括利用大规模语言模型对自噬相关基因或蛋白质的功能代码进行生成与验证,例如预测自噬调控路径中的关键蛋白结构或功能域编码。通过提供程序化的提示(prompt)与补全(completion)对,研究者可训练模型自动完成自噬相关生物代码的编写任务,从而加速细胞自噬机制的 computationally 表征与仿真。
实际应用
在实际应用中,该数据集可用于开发面向自噬研究的代码生成工具,辅助生物学家自动化生成用于模拟自噬过程(如自噬体形成)的程序脚本。例如,基于该数据集训练的模型能够根据蛋白质序列输入直接输出对应的分析代码,从而降低生物信息学门槛。此外,该数据集的信任策略生成机制保证了代码的可靠性,使其适用于药物虚拟筛选与自噬通路建模等场景,有望提升自噬相关药物研发效率,并助力个性化治疗方案中自噬活性的计算机辅助评估。
衍生相关工作
该数据集的构建策略衍生了一系列相关工作,尤其是在代码生成与生物序列预测的融合领域。其信任策略(trust strategy)与温度采样参数(t1.25, g10)的设定启发研究者探索更鲁棒的弱监督代码生成方法,例如基于自洽性过滤或对比学习的高质量代码对生成范式。同时,该数据集作为Qwen3-8B模型在特定领域微调的案例,催生了针对其他细胞过程(如凋亡、铁死亡)的代码生成数据集构建工作。这些衍生研究共同推动了生物大模型从通用代码能力向专业生命科学任务的深化适配,奠定了计算生物学与自然语言处理协同创新的实证基础。
以上内容由遇见数据集搜集并总结生成



