stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g7_run1_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含关于代码质量、可维护性和测试结果的多种特征,例如Halstead复杂度、圈复杂度、维护性指数、代码行数、测试通过/失败次数等,适用于代码分析任务。
This dataset contains various features related to code quality, maintainability, and test results, such as Halstead metrics, cyclomatic complexity, maintainability index, lines of code, and test pass/fail counts, suitable for code analysis tasks.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g7_run1_metrics,旨在评估代码生成模型在推理任务中的表现。数据集的构建基于代码自动化执行与静态分析相结合的方式:首先,通过模型生成的代码片段在受控环境中执行,记录其可执行性(is_executable)、正确性(is_correct)及测试通过数(tests_passed)等运行时指标;随后,运用Halstead复杂度度量体系(如词汇量、长度、体积、难度、工作量及时间)、圈复杂度(cyclomatic_complexity)、维护性指数(maintainability_index)及代码行数(loc、sloc)等静态度量指标,对生成的代码进行多维度的量化分析。该数据集共包含164个样本,所有样本均统一归入训练集,便于后续的模型评估与对比研究。
特点
该数据集的核心特点在于其深度融合了执行结果与代码质量的双重评估维度。运行时指标(如测试通过数、失败数及错误类型)直观反映了模型产出代码的功能正确性;而Halstead复杂度、圈复杂度和维护性指数等静态度量,则揭示了代码的结构复杂度和可维护性。此外,数据集还引入了香农熵(shannon_entropy)、预测熵(mean_predictive_entropy与max_predictive_entropy)等不确定性指标,以及词性标注的TTR(型例比)和函数定义数(n_func_defined)等文本特征,为理解模型在不同熵值条件下的代码生成行为提供了独特视角。这些丰富的特征组合,使得该数据集不仅可用于评测代码的正确性,还能深入分析代码的可靠性与优化潜力。
使用方法
使用该数据集时,研究人员可基于提供的164个训练样本,开展代码生成模型的性能评估与对比分析。具体而言,可将模型生成的代码对应的task_id与entry_point作为唯一标识,通过is_correct和tests_passed字段量化模型的准确性与鲁棒性。同时,可利用Halstead度量、圈复杂度及维护性指数等特征,分析模型在生成简洁、高效代码方面的能力。若需探索模型的内在不确定性对其输出代码质量的影响,可结合shannon_entropy与预测熵等特征进行相关性研究。数据以标准的HuggingFace数据集格式存储,用户可通过加载默认配置(default)的train分割,轻松集成至Python的机器学习或统计分析流程中。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,基于Qwen3-8B模型在MERCURY代码生成任务上的推理输出,采用信任阈值1.25与生成轮次7的策略进行筛选与标注。数据集旨在系统性地评估与剖析代码生成模型的执行正确性,涵盖代码复杂度、可维护性、执行效率及预测不确定性等多维度指标。通过收集164个训练样本,数据集深入探索了大型语言模型在代码合成中的行为特征,为理解模型在编程任务中的泛化能力与可靠性提供了关键支撑,对代码智能领域具有重要的实证价值。
当前挑战
当前数据集面临的挑战聚焦于代码生成领域内两个层面。在领域问题层面,如何确保生成代码不仅通过测试用例,还满足实际执行中的鲁棒性与效率要求,是亟待解决的难题,单纯的功能正确性已不足以衡量模型实用性。在构建过程层面,数据集仅含164个样本,样本规模较小可能限制统计显著性与泛化结论的可信度;同时,特征中包含的halstead与香农熵等复合指标的计算依赖代码的符号执行与静态分析,对于常见库函数或动态特性的支持不足,易引入偏差。此外,生成轮次与信任阈值的选择虽经刻意设计,但其最优配置仍需更大规模实验验证,且元特征的维度膨胀增加了过拟合与解释性下降的风险。
常用场景
经典使用场景
该数据集专为代码生成与智能体任务中的策略评估而设计,其核心应用在于衡量大语言模型在生成可执行代码时的正确性与鲁棒性。通过记录任务ID、入口函数、测试通过率及执行耗时等结构化信息,研究者可系统性地分析模型在编程基准上的表现差异,尤其适用于探索模型在复杂逻辑推理与代码合成场景中的行为模式。数据集还融合了Halstead复杂度、圈复杂度、可维护性指数等软件工程指标,为深入理解代码质量与模型生成策略之间的关联提供了量化基础,成为代码智能体调试与性能调优的理想测试床。
实际应用
在实际应用中,该数据集可作为持续集成管线的质量门禁,用于自动评估代码生成模型的迭代版本是否引入性能退化。开发团队可依据测试通过率、代码可维护性指数等指标,快速筛选出在特定任务上表现稳健的模型,从而辅助模型选型与部署决策。数据集亦支持对模型生成的代码进行细粒度审计,帮助工程师识别高频错误模式并优化训练数据或推理策略,进而提升编码助手、自动化测试生成等下游产品的实用性与用户信任度。
衍生相关工作
围绕该数据集,衍生出一系列聚焦于代码智能体鲁棒性增强与质量可解释性的研究工作。研究者利用其丰富的复杂度与熵值特征,构建了代码生成质量的预测模型,实现了在无测试用例情况下对执行成功率的预判。此外,部分工作基于数据集中的错误类型分布,设计了针对性的对抗训练方案或后处理修复机制,显著提升了模型在边界条件下的生成成功率。更有工作将其作为基准,对比不同提示策略与模型架构对代码可维护性及执行效率的影响,为代码合成领域注入了兼顾功能正确性与代码卫生度的新评估范式。
以上内容由遇见数据集搜集并总结生成



