遇见数据集

stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g1_run2

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: top_k_progression dtype: string - name: test dtype: string splits: - name: train num_bytes: 8069681 num_examples: 142 download_size: 1934704 dataset_size: 8069681 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g1_run2 数据集图片
构建方式
该数据集是针对代码生成任务构建的微调数据集,基于自吞噬循环(Autophagy)策略,以Qwen3-4B为基座模型,在特定学习率(lr=0.0001)下对142个编程题目进行迭代生成与筛选。数据集包含task_id、entry_point、prompt、completion、top_k_progression及test等字段,其中completion为模型生成的代码解决方案,top_k_progression记录生成过程中的top-k候选演化轨迹,通过信任阈值(trust_t1.1)与生成轮次(g1)控制数据质量,最终汇聚为单一训练分片。
特点
数据集的核心特点在于其自完善机制:利用模型自身输出构建训练语料,通过top_k_progression字段保留了代码生成的渐进优化路径,为研究模型迭代学习提供了细粒度演化信息。数据集规模精巧(142条),每条样本包含完整的问题描述、入口函数及测试用例,适合快速验证代码生成模型的微调效果。此外,数据集的字段设计兼顾了训练与评估需求,test字段可直接用于自动化评测,体现了实用性与研究价值的统一。
使用方法
数据集可通过HuggingFace的datasets库加载,默认配置名为‘default’,数据文件以parquet格式存储于data/train-*路径下。使用时可直接调用load_dataset('autophagycode_D_mercury_Qwen3-4B_lr0.0001_c142_trust_t1.1_g1_run2')获取训练集。建议将prompt字段作为模型输入,completion字段作为目标输出,结合entry_point和test字段进行代码编译与测试用例验证,适用于代码生成任务的监督微调或强化学习训练流程。
背景与挑战
背景概述
该数据集由autophagycode团队创建,基于Qwen3-4B模型在特定超参数(学习率0.0001,上下文长度142)下生成,旨在研究代码生成任务中的自我信任机制与渐进式推理能力。核心研究问题聚焦于如何通过控制模型生成过程中的信任阈值与生成轮次,提升代码补全任务的准确性与鲁棒性。该数据集通过记录模型在多个生成步骤中的候选序列演化,为探索大语言模型在编程辅助领域的可解释性与可靠性提供了重要资源,对推动代码智能体的自我纠错与逻辑连贯性研究具有潜在影响力。
当前挑战
当前数据集面临的主要挑战包括:1)领域问题层面,代码生成任务需应对逻辑复杂度高、语法约束严格的天然难题,现有模型常出现语义错误或结构不完整,数据集旨在探索通过多步推理与信任校准缓解此问题;2)构建过程中,数据规模仅142条示例,较小样本量可能限制模型泛化能力,且生成过程依赖特定模型与超参数,导致数据集在跨模型迁移时的适应性存疑;此外,标注质量与任务多样性的平衡亦是构建时需克服的关键障碍。
常用场景
经典使用场景
该数据集专为代码生成与自动补全任务而设计,常见于优化大型语言模型在编程领域的指令遵循能力。其核心特性在于包含任务标识、函数入口点、提示文本与补全代码等字段,适用于监督微调与强化学习范式。研究者常利用此类结构化数据,训练模型在给定函数签名或自然语言描述的情况下,生成准确且逻辑严谨的代码片段。这一场景在自动化编程助手与开发者工具中尤为典型,旨在提升模型对程序语法与语义的理解深度。
实际应用
在实际应用中,该数据集可用于训练企业级代码自动补全插件,如集成开发环境中的智能提示系统,加速开发者编写常见算法或业务逻辑。其结构化字段支持定制化模型调优,例如针对特定编程语言或框架生成安全合规的代码片段。此外,在在线编程教育平台中,它能够赋能自动评分与实时纠错功能,通过对比模型输出与标准解来提供个性化反馈,从而降低学习门槛并提升教学效率。
衍生相关工作
基于此类代码生成数据集,衍生出多项经典工作,包括基于强化学习的代码策略优化模型、对比学习增强的代码表征网络以及多任务联合训练框架。例如,有研究利用其补全进展字段设计了渐进式解码算法,显著提升了复杂函数生成的准确率。另有工作将其与静态分析工具结合,构建了鲁棒性更强的代码验校系统。这些探索不仅拓展了数据集在软件工程中的适用边界,也为后续神经网络架构创新奠定了基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务