遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g1_run1

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 7012640 num_examples: 142 download_size: 1779141 dataset_size: 7012640 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-8B_lr0.0001_c142_trust_t1.25_g1_run1 数据集图片
构建方式
该数据集源自自动化代码生成领域的探索,旨在提升大语言模型在复杂编程任务上的表现。其构建基于HuggingFace平台上的Qwen3-8B模型,采用有监督微调策略,在特定学习率(lr=0.0001)和温度参数(t=1.25)下,通过自洽性解码与信任度筛选机制,从142个精选编程题目中生成并收集高质量代码补全样本。每个样本包含任务标识、函数入口、提示文本、模型输出、以及top-k逐步推理过程和测试用例,形成结构化的训练数据。
特点
该数据集的一个显著特点是其规模精巧而内涵丰富:仅包含142个训练样本,却涵盖了完整的编码任务链条。每条记录不仅提供了标准的输入输出对,还保留了模型在解码过程中的多步推理轨迹(top_k_progression),这为研究模型内部推理逻辑、探索逐步生成质量提供了独特视角。同时,数据集中显式保存了测试用例,便于对生成代码进行自动化正确性验证,从而确保训练数据的健壮性与可复现性。
使用方法
使用时,用户可直接加载HuggingFace上的默认配置,通过'data/train-*'路径读取训练数据。推荐将'prompt'字段作为输入,'completion'字段作为监督标签,用于微调其他代码生成模型。此外,'top_k_progression'字段可辅助研究置信度演化与推理路径,而'test'字段则为模型评估提供了现成的自动化测试基准,支持在迭代训练中实时验证模型生成代码的通过率,实现从数据到性能评估的闭环优化。
背景与挑战
背景概述
该数据集由autophagycode团队于近年创建,基于Qwen3-8B模型在特定超参数配置(学习率0.0001、温度1.25、生成系数1)下生成,聚焦于代码生成任务的细粒度评估。核心研究问题在于探索预训练语言模型在代码补全与生成中的渐进式推理能力,通过top_k_progression字段记录生成过程的逐步进展,为理解模型决策路径提供结构化数据。尽管数据集规模较小(仅142条训练样本),但其专门化的设计在代码智能领域具有独特价值,尤其适用于研究模型从给定入口点(entry_point)和提示(prompt)到最终完成(completion)的逐步生成逻辑。该工作为评估大语言模型在编程任务中的内部推理机制提供了新的基准,推动了代码生成评估从单一结果向过程可解释性的转变。
当前挑战
当前数据集面临的核心挑战在于领域问题与构建过程双重层面。在领域问题方面,代码生成任务本身存在复杂性,如处理多样化的编程风格、语法正确性与语义一致性的平衡,以及模型对长距离依赖关系的捕捉能力。该数据集所追踪的渐进式生成过程虽有助于理解模型推理,但如何量化生成路径的合理性与效率仍是难点。在构建过程中,数据量仅有142例,且基于单一模型(Qwen3-8B)和特定参数配置,导致样本分布可能偏离真实编程场景,泛化能力受限。此外,超参数如温度(1.25)对生成多样性的影响需进一步验证,数据质量的自动化校验也缺乏统一标准,限制了其在更广泛任务中的适用性。
常用场景
经典使用场景
该数据集由142条精心构造的样本组成,聚焦于代码生成与任务规划的交汇领域,特别针对自噬相关(autophagy)的生物信息学场景。每条样本包含任务标识(task_id)、入口函数(entry_point)、提示词(prompt)、代码补全结果(completion)、渐进式top-k状态(top_k_progression)以及测试用例(test),为多步代码生成与测试驱动开发提供了标准化的数据支撑。典型用法是输入自然语言描述的函数目标(prompt),驱动语言模型输出可执行的Python代码片段(completion),并利用测试(test)对生成结果进行自动化验证。这一设计使研究者得以系统性地评估模型在复杂生物计算任务中的逻辑连贯性与代码质量。
解决学术问题
学术上,该数据集直面当前大语言模型在领域特定代码生成中泛化能力不足的挑战。自噬过程的分子机制涉及高度专业化的蛋白质互作网络与基因调控模型,通用代码数据集难以覆盖此类稀疏且语义密集的问题空间。通过精心设计的提示词与渐进式输出结构,数据集解决了模型在多步推理、边界条件处理以及函数间依赖关系建模上的短板。其核心贡献在于提供了可复现的基准测试,推动学术界从单纯追求代码语法正确性转向更为关键的语义符合性与功能完备性评估,从而为计算生物学与人工智能的交叉研究开辟了新范式。
衍生相关工作
该数据集衍生出的经典工作主要围绕领域自适应的指令微调与涌现能力分析展开。研究者在Qwen3-8B基座模型上引入基于该数据集的微调策略,探索了学习率(0.0001)、温度系数(1.25)与梯度裁剪(1.0)等超参数对代码生成质量的影响。进一步的工作包括:构建基于top_k_progression场的状态机推理框架,用于追踪模型在多步生成中的决策路径;开发结合测试用例回溯的对比学习模块;以及将数据集扩展为多任务学习范式,将自噬相关代码生成与序列标注、关系抽取等任务联合训练。这些衍生研究共同推动了代码智能在垂直学科中的深度落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务