遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run2

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 5452444 num_examples: 164 download_size: 1482233 dataset_size: 5452444 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run2 数据集图片
构建方式
该数据集基于自噬相关代码任务构建,采用Qwen3-4B模型结合信任策略(trust)进行生成,并通过温度参数t=1.25与生成轮次g=3的配置,经过多次迭代筛选与优化,最终筛选出164条高质量训练样本。数据集的构建聚焦于代码生成任务的可靠性与多样性,通过策略性采样和信任度评估,确保每个样本在任务适配性和生成质量上达到较高标准。
特点
数据集包含六个字段:task_id、entry_point、prompt、completion、top_k_progression及test,全面覆盖了代码生成任务的关键环节。其核心特点在于通过top_k_progression记录生成过程中的候选序列演进,为模型推理路径分析提供丰富信息。此外,数据集规模精炼,仅164条样本即承载了任务类型、代码结构与测试用例的多样性,适合用于小样本场景下的模型微调与评估。
使用方法
数据集以HuggingFace格式存储,包含单一训练集(train),共164条样本,总大小约5.2MB。用户可通过HuggingFace的datasets库直接加载,指定配置名'default'后即可获取数据。每条样本提供从prompt到completion的完整映射,并附带测试用例(test),便于直接用于代码生成任务的训练与验证。建议将prompt作为输入,completion作为目标输出,利用test字段进行自动化评估。
背景与挑战
背景概述
该数据集由自主ophagycode研究团队创建,专注于探索大语言模型(如Qwen3-4B)在代码生成任务中的自进化学习能力。数据集构建于近期,旨在解决模型通过自我反馈机制迭代提升代码质量的核心研究问题。其设计融合了策略信任机制与温度采样等技术,为复杂代码推理任务提供了高效训练样本。该数据集通过精细的指令对结构,推动了大模型在代码生成领域的自监督学习范式发展,对提升模型代码生成准确性与鲁棒性具有重要参考价值。
当前挑战
当前数据集面临的核心挑战在于代码生成任务中模型自我纠错与反馈机制的稳定性与泛化能力。具体包括:1)如何确保模型在缺乏外部验证信号时,能够从自身生成样本中可靠识别语义错误与逻辑缺陷;2)构建过程中,需平衡探索-利用困境,避免模型陷入局部最优或生成多样性不足;3)数据集规模较小(仅164例),限制了模型对复杂代码结构的长程依赖学习,亟需在数据增强与少样本学习范式下寻求突破。
常用场景
经典使用场景
该数据集专为代码生成与逻辑推理任务而设计,其核心应用在于训练和评估大语言模型在复杂编程问题上的求解能力。数据集中包含了任务标识、函数入口点、自然语言描述的问题提示、对应的代码补全结果、逐步推理过程以及测试用例,这使其成为研究少样本提示与思维链推理在自动编程中效能的理想资源。研究者常利用该数据集检验模型是否能够根据给定的提示,生成符合预期逻辑且能通过测试的代码片段,尤其关注模型在信赖度阈值与温度系数调控下的生成质量与鲁棒性。
衍生相关工作
该数据集的发布催生了一系列关于代码生成中推理可信度与策略调优的衍生研究。相关工作包括基于信赖度阈值过滤的低质量代码生成方法、针对多轮修正的迭代推理框架,以及融合温度系数与采样多样性的自适应生成策略。此外,该数据集也为对比分析不同规模模型(如Qwen系列)在代码补全任务中的表现提供了基准,并启发了将逐步推理提示与外部代码执行环境相结合的工作,以动态验证生成代码的语义正确性,进一步扩展了数据集在程序合成与形式验证交叉领域的应用边界。
数据集最近研究
最新研究方向
当前,大型语言模型在代码生成与推理任务中的可靠性已成为学界焦点。该数据集聚焦于自噬机制的生物信息学代码生成,通过Qwen3-4B模型结合信任策略与温度采样(t=1.25, g=3)构建训练集,开辟了将前沿AI技术应用于细胞自噬研究的新范式。数据集中包含任务标识、代码入口点、提示与完成对及top-k进展等结构化字段,为探索模型在专业领域代码生成中的置信度校准与多步推理能力提供了关键资源。特别是在自噬相关疾病靶点预测与药理学机制建模等热点方向,该数据集有望推动可解释、可验证的AI辅助科研工具发展,其蕴含的模型策略优化思路对提升LLM在科学计算中的鲁棒性具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务