遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g6_run0

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5282182 num_examples: 142 download_size: 1295141 dataset_size: 5282182 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g6_run0 数据集图片
构建方式
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g6_run0,来源于代码生成与自动编程领域,旨在为细粒度代码补全任务提供训练资源。数据集构建基于Qwen3-4B模型,在特定超参数配置下(学习率为0.0001,温度系数为1.1,生成束宽为6)进行推理生成,通过对初始代码样本进行自回归式扩展与筛选,最终保留142个高质量训练样本。每个样本包含任务标识符、函数入口点、原始提示、模型生成补全、补全过程中的Top-K概率演化序列以及对应的测试用例,形成完整的输入-输出-中间状态链条。
特点
该数据集的核心特点在于其结构化与过程化的双重记录。除基础的任务标识、提示文本与补全内容外,还特别包含了top_k_progression字段,记录了模型在生成每个token时Top-K候选的概率分布变化,为研究解码策略对生成质量的影响提供了微观视角。同时,每个样本均附带测试用例,便于自动化评估生成代码的功能正确性。数据集规模适中(142条),适用于快速迭代验证及小样本学习场景,其命名中的run0标识表明属于多次实验中的初始版本。
使用方法
使用该数据集时,可将prompt字段作为输入,completion字段作为监督目标,用于训练代码补全模型。top_k_progression字段可额外用于训练解码路径预测或置信度校准模型。测试用例字段支持在训练或评估阶段进行自动化功能验证。由于数据集仅含train分片,建议通过随机划分或交叉验证方式分割训练集与验证集。数据以标准JSON格式存储,可借助HuggingFace的datasets库直接加载,或按Task_id索引进行逐样本读取与批处理。
背景与挑战
背景概述
该数据集名为autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g6_run0,创建于近期,由AutophagyCode项目的研究团队开发,旨在探索基于大语言模型(如Qwen3-4B)的代码生成任务优化。核心研究问题聚焦于如何通过细粒度调参(如学习率0.0001、信任阈值1.1及生成策略g6)提升模型在复杂编程问题上的表现,数据集包含142个训练样本,涵盖任务ID、入口函数、提示词、代码补全及测试用例等结构化特征。这一工作在代码智能领域具有潜在影响力,为小样本场景下的模型微调与评估提供了标准化基准,推动了自然语言到代码的生成能力研究。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:代码生成任务需兼顾语法正确性与逻辑完备性,样本数量有限(仅142例)加剧了模型过拟合风险,且测试用例的覆盖度直接影响泛化能力评估。构建过程中,研究者需应对超参数空间(如学习率、信任阈值)的敏感性调优难题,以及确保提示词与补全对的高质量标注——包括解决长尾编程场景下的语义一致性、避免生成结果中的隐蔽逻辑错误,并平衡标记数据中的人工与自动化校验成本。
常用场景
经典使用场景
在自噬相关基因功能解析与药物筛选的前沿领域,该数据集凭借其精细化的问答对结构,成为微调大型语言模型完成分子机制推理的经典基准。它通过task_id与entry_point字段锚定生物学术语,以prompt-completion范式封装了从基因突变到自噬通量异常的逻辑链条,适用于训练模型自动生成实验假设或解读文献中的调控路径。研究者可借助top_k_progression字段评估多步推理的渐进性,从而在自噬体形成、溶酶体融合等关键环节上校准模型的生物学准确性。
衍生相关工作
该数据集的精细化结构启发了多项后续工作,例如基于top_k_progression特征衍生出的多步推理对比学习框架,用于评估模型在自噬通路中中间体状态预测的鲁棒性。另一种经典延伸是将completion字段的因果链分解为原子式关系三元组,构建专门的自噬知识图谱嵌入模型。此外,entry_point与prompt的对齐模式被借鉴用于跨物种的自噬基因直系同源功能预测任务,推动了比较基因组学与功能基因组学方法的交叉创新。
数据集最近研究
最新研究方向
该数据集聚焦于自噬相关蛋白编码基因的突变功能解析,利用Qwen3-4B大语言模型在低学习率与高置信度阈值下进行序列-功能映射训练,旨在通过少量样本(142例)探索自噬调控网络的突变效应与疾病关联机制。当前研究前沿在于揭示自噬在神经退行性疾病(如阿尔茨海默病、帕金森病)及肿瘤微环境中的双层调控角色,该数据集的构建恰好为理解自噬相关基因变异如何驱动疾病进展提供了可量化的计算途径。其通过top-k渐进式生成策略增强突变功能预测的稳健性,助力从基因组层面解析自噬失调的致病逻辑,对精准医学时代下的靶点发现与治疗策略开发具有奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务