stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run2_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含代码任务的静态分析指标和测试结果,包括代码复杂度、可维护性、代码行数、测试通过/失败情况、错误类型等特征,共164个样本。
This dataset contains static analysis metrics and test results for code tasks, including code complexity, maintainability, lines of code, test pass/fail counts, error types, etc., with 164 samples.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集源自对代码生成模型的评估过程,具体而言,它承载了由Qwen3-4B模型在特定策略(trust_t1.1_g7_run2)下生成的代码执行与质量分析结果。数据集的构建以代码执行的二元反馈为核心,通过记录每个编程任务(task_id)的入口函数(entry_point)、代码可执行性(is_executable)、正确性(is_correct)以及通过与失败的测试用例数量(tests_passed、tests_failed)来量化生成代码的功能表现。此外,数据集融合了代码静态分析的多维指标,包括Halstead复杂度(词汇量、长度、体积、难度、工作量及时间)和McCabe圈复杂度(cyclomatic_complexity),并引入可维护性指数(maintainability_index)、代码行数统计(loc、sloc)及注释比例(comment_percentage),形成了对代码可读性与复杂度的系统性刻画。在语义层面,数据集纳入了基于token的文本重复率(TTR)、香农熵(shannon_entropy)以及预测性熵值(mean_predictive_entropy、max_predictive_entropy),以捕捉生成代码的多样性与不确定性。最终,通过存储完整的token字典(token_dict)和函数定义计数(n_func_defined),实现了对代码生成过程的结构化归档。
特点
本数据集最显著的特点在于其评估维度的全面性与层次性。它不局限于对代码正确性的二元判断,而是构建了一个从执行结果(测试通过/失败)、运行时性能(test_run_time_ms)到代码质量(复杂度、可维护性)的立体评估体系。其中,Halstead和McCabe指标的组合能够有效反映代码的逻辑复杂度与理解难度,而香农熵与预测性熵的引入则为分析生成代码的语义不确定性提供了量化工具。数据集的另一个突出特性是对错误类型的记录(error_type),允许研究人员深挖生成代码失败的具体原因。所有特征都围绕164个训练样本(train split)展开,样本量虽小但特征空间丰富,适合作为细粒度代码生成质量评估的基准测试集。此外,数据类型涵盖字符串、整数、浮点数和布尔值,兼顾了分类与连续变量的分析需求。
使用方法
该数据集主要用于代码生成模型的评估与分析研究,尤其适合探究模型生成代码的质量与多样性。使用者可将其加载至Python环境,通过读取特征列(如task_id、is_correct、tests_passed)进行模型性能的纵向对比。建议利用Halstead复杂度与可维护性指数来量化生成代码的工程质量,或借助熵值指标(shannon_entropy、mean_predictive_entropy)分析模型输出的随机性。数据中的token_dict字段支持对生成代码进行词法层面的还原与再分析,而error_type字段能辅助分类统计不同代码错误的分布模式。由于数据集仅包含训练集,且数据量适中(约237KB),可直接用于小规模验证实验或作为教学范例。使用时需注意test_run_time_ms列可能为空值,应进行相应预处理。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run2_metrics,由AutophagyCode团队基于Qwen3-4B模型在信任策略(trust strategy)下生成,核心研究问题聚焦于评估代码生成模型在Python编程任务中的执行正确性、代码质量与复杂性。数据集包含164个训练样本,涵盖了从任务标识、执行状态判断到复杂度度量(如圈复杂度、Halstead指标、维护性指数)及信息熵等多维特征,旨在为代码智能领域提供细粒度的模型输出质量评估基准。该资源的创建反映了当前对大型语言模型生成代码的可信性与可维护性日益增长的关注,对于推动代码生成技术的安全可靠应用具有重要参考价值。
当前挑战
数据集所解决的领域挑战在于,现有代码生成评估多侧重于通过率或语法正确性,而忽视了对代码内在质量、复杂度及可维护性的系统度量。其构建过程中面临多项技术挑战:首先,需从模型生成的庞杂输出中提取并计算多达20余项软件工程指标,如Halstead时长与圈复杂度,这要求高精度的静态分析工具与自动化流水线。其次,确保`is_executable`、`is_correct`等标签的准确性需处理执行环境差异与测试用例覆盖完整性问题。此外,`error_type`字段的归因与`predictive_entropy`等不确定性度量的引入,增加了构建时对模型行为与代码语义耦合关系的解析难度,最终形成了这个兼具执行验证与代码质量剖析的综合性评估资源。
常用场景
经典使用场景
在代码智能与软件工程研究领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run2_metrics数据集为评估大型语言模型(LLM)在代码生成任务中的表现提供了精细化的度量标准。该数据集汇集了164个训练样本,每个样本包含丰富的代码质量指标,如圈复杂度、Halstead复杂度、可维护性指数以及执行正确性信息。研究者可基于这些多维特征,深入分析模型生成代码的复杂度分布、执行准确性及错误类型,从而量化模型在不同编程任务中的能力边界。数据集特别适用于研究模型在Trust策略及Qwen3-4B架构下的生成行为,为探索代码生成的可信度与鲁棒性奠定了实证基础。
实际应用
在实际工程场景中,该数据集可服务于自动化代码审查与质量保障系统的构建。例如,基于数据集中的可维护性指数与圈复杂度特征,可以开发预警机制,标记模型生成的高风险代码片段,辅助开发人员优先审查逻辑复杂或难以维护的生成结果。此外,数据集中的测试执行数据(如运行时间、通过/失败计数)能够为持续集成(CI)管道提供基准,用于实时监控生成代码的运行时稳定性。在低代码开发平台中,利用该数据集的度量体系可优化智能补全与代码推荐功能,确保推荐方案不仅语法正确,还符合企业级代码质量规范,从而提升开发效率并降低技术债务。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作。围绕其核心度量指标,研究者提出了基于软件度量的代码生成质量评估框架,例如利用Halstead难度与维护指数构建多目标优化函数,指导模型在推理时权衡代码简洁性与执行正确性。数据集中的错误类型标注催生了针对生成代码的故障诊断研究,包括错因分类与修复建议生成。此外,基于Shannon熵与预测熵的元数据,衍生了动态解码策略调整算法,使模型能够在生成过程中自适应降低代码的认知不确定性。这些工作共同推动了从静态评估到动态引导的代码生成研究新方向,为后续更可靠、更可控的代码智能系统的发展提供了坚实的数据支撑与理论启示。
以上内容由遇见数据集搜集并总结生成



