遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 248136 num_examples: 164 download_size: 99176 dataset_size: 248136 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run2_metrics,其构建依托于大语言模型代码生成任务的自动化评估流程。数据集包含164个训练样本,每个样本对应一个编程任务,涵盖了从任务标识、函数入口点、执行正确性到代码质量指标的多维度信息。具体而言,每条记录记录了模型生成代码的执行结果(如是否可执行、测试通过或失败数量、运行时间)、错误类型,以及从静态分析中提取的代码复杂度特征,包括Halstead度量、圈复杂度、可维护性指数、代码行数、注释比例、词汇丰富度(TTR)和香农熵等。这些数据通过自动化测试框架与静态分析工具联合采集,为深入分析模型生成代码的可靠性与质量特性提供了结构化支撑。
特点
该数据集的核心特点在于其多模态的代码评估视角。除了基础的执行正确性标记(is_correct和is_executable)外,还纳入了细粒度的代码度量体系,如Halstead难度与工作量、圈复杂度、可维护性指数等,能够从可读性、效率与复杂性层面刻画代码质量。此外,数据集引入了预测性熵值(mean_predictive_entropy和max_predictive_entropy)以及词汇分布(token_dict和TTR),这些特征有助于探究模型生成代码的语义不确定性。值得一提的是,数据集还记录了函数重复定义情况(entry_point_repeated),进一步丰富了代码结构一致性的评估维度。整体上,该数据集兼具执行验证与静态分析的双重属性,适合用于代码生成模型的性能诊断与质量评估研究。
使用方法
该数据集以HuggingFace标准格式存储,仅包含一个训练集(train split),共164条数据,文件路径为data/train-*。用户可通过datasets库加载,使用load_dataset('autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run2_metrics')命令直接调用。数据字段丰富,适合用于代码生成模型的对比分析、错误模式归类、代码质量预测等任务。研究人员可依据is_correct和tests_passed等字段筛选正确样本,或结合Halstead与圈复杂度等指标评估生成代码的工程可维护性。同时,预测性熵值可作为模型不确定性的代理变量,用于校准模型输出的置信度。该数据集为后续模型的迭代优化提供了多维度的反馈依据。
背景与挑战
背景概述
该数据集由研究团队基于Qwen3-8B模型,采用autophagycode_D_he_train项目与mercury策略融合生成,专注于代码生成任务的细粒度评估。其创建旨在系统量化代码质量的多维指标,涵盖可执行性、正确性、测试通过率以及Halstead复杂度、圈复杂度、维护性指数等软件工程度量。作为连接大语言模型代码生成能力与传统代码质量评估的桥梁,该数据集为理解模型输出代码的功能正确性与结构合理性提供了实证基础,推动代码智能领域的评估范式从单一正确性向综合性质量度量演进。
当前挑战
数据集面临的核心挑战在于弥合模型生成代码的功能验证与工程质量之间的鸿沟。具体而言,需解决如何从测试通过率、错误类型等动态执行结果中,分离出与编码风格、算法效率相关的静态质量特征,避免将编译错误或运行失效简单归因于模型能力缺陷。构建过程中,挑战集中于自动化提取代码的Halstead复杂度、圈复杂度等数十项指标,并确保这些度量在164个训练样本上的一致性校准,以防止过拟合或度量偏移对模型优化方向的误导。
常用场景
经典使用场景
在代码智能与软件工程领域,对自动生成代码的质量与安全性评估始终是核心挑战之一。该数据集聚焦于大语言模型生成的Python代码片段,提供了丰富的细粒度质量指标,涵盖可执行性、测试通过率、多种代码复杂度度量(如圈复杂度、Halstead复杂度)以及熵值等。其最经典的使用场景是作为代码生成模型输出的基准评估基准,研究者可借此系统性地分析模型在功能性、可维护性和语法正确性上的表现,从而量化不同生成策略(如温度采样、信任阈值调整)对代码质量的影响。
实际应用
在实际工程应用中,该数据集可为自动代码审核工具和低代码开发平台提供关键支撑。开发团队可借助其丰富的质量标注,训练分类器以自动甄别模型生成代码中的潜在缺陷(如高圈复杂度或低可变性分数),从而在CI/CD流程中实现智能化的代码准入控制。此外,对于教育领域,该数据集可用于分析学生或初级开发者编写代码的常见错误模式,辅助编程教学与个性化反馈系统,提升代码质量教育的针对性和效率。
衍生相关工作
围绕该数据集的特性,已衍生出一系列前沿研究工作。例如,研究者利用其中的熵值与复杂度特征,提出了一种基于预测不确定性的代码错误检测方法,实现了对模型生成失败样本的早期预警。另一些工作则构建了多任务学习框架,同时预测代码的可执行性和维护指数,显著提升了代码质量评估的联合精度。此外,该数据集也被用于对比不同解码策略(如Top-k采样与核采样)对代码结构复杂性的差异化影响,推动了代码生成策略优化的理论进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务