stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run1_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含代码任务的执行结果和静态代码度量。每个样本包括任务ID、入口点、是否可执行、是否正确、测试通过/失败数量、运行时间、错误类型,以及多种代码复杂度指标,如Halstead词汇量、长度、体积、难度、工作量、时间,圈复杂度,可维护性指数,代码行数,有效代码行数,注释百分比,词元比率,词元字典,香农熵,预测熵等。
This dataset contains execution results and static code metrics for code tasks. Each sample includes task ID, entry point, executability, correctness, number of tests passed/failed, runtime, error type, and various code complexity metrics such as Halstead vocabulary, length, volume, difficulty, effort, time, cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, type-token ratio, token dictionary, Shannon entropy, predictive entropy, etc.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集源自对大型语言模型在代码生成任务中输出质量的系统评估与度量。基于Qwen3-4B模型在特定策略(trust_t1.1_g7_run1)下的推理结果,通过自动执行测试用例来判定代码的正确性与可执行性,并记录通过与失败的测试数量。同时,利用软件工程度量工具对生成的代码片段进行多维度的静态分析,涵盖Halstead复杂度指标(如词汇量、长度、体积、难度、工作量及时间)、圈复杂度、可维护性指数、代码行数、注释比例、词元比(TTR)及香农熵等。每个样本对应一个编程问题,包含唯一的任务标识与入口函数名称,最终整合为164条训练样本,形成结构化的评估数据集。
特点
本数据集的最大特点在于其多维度的代码质量评估体系,不仅包含传统的正确性验证(通过/失败测试计数),还引入了丰富的软件度量指标以刻画代码的内在复杂性。例如,Halstead系列指标从操作符与操作数的统计角度量化代码认知负荷,而圈复杂度和可维护性指数则反映控制流复杂性与可维护成本。此外,数据集收录了预测性熵值(平均与最大预测熵)及香农熵,可有效关联模型对代码生成的置信度。所有特征均为数值或布尔类型,便于进行统计分析、模型对比以及生成质量的建模研究,为理解大模型代码生成行为提供了细粒度的量化依据。
使用方法
使用该数据集时,可直接通过HuggingFace Datasets库加载,指定配置名为'default'并选用'train'数据分片。加载后的每一行样本均包含完整的度量字段,可用于构建回归或分类任务,例如预测代码可执行性(is_executable)、正确性(is_correct)或量化代码复杂度。分析人员可基于task_id与原始问题集进行关联,或利用entry_point字段定位特定函数。建议结合软件工程背景对Halstead与圈复杂度等指标进行归一化或对数变换后使用,以应对潜在偏态分布。后续可扩展为多轮微调或模型行为诊断的基础评价基准。
背景与挑战
背景概述
该数据集由智能计算与语言模型评估领域的研究团队构建,旨在深入剖析大语言模型在代码生成任务中的性能表现与内在缺陷。数据集创建于2025年,依托于Qwen3-4B模型在“信任与策略”微调框架下的生成结果,核心研究问题聚焦于模型生成代码的可执行性、正确性以及代码复杂度与可维护性的多维评估。通过整合Halstead复杂度、圈复杂度、可维护性指数以及香农熵等精细指标,该数据集为理解语言模型在自动化编程领域的可靠性提供了前所未有的量化视角,推动了代码智能评估从简单的通过率向全方位质量度量迈进。
当前挑战
当前数据集面临的核心挑战在于如何弥合代码生成模型在受控环境与真实世界部署之间的性能鸿沟。领域问题层面,尽管模型在标准测试集上表现出色,但其生成代码的语法正确性与实际功能正确性间仍存在显著偏差,且对于复杂逻辑的捕获能力有限。构建过程中,传统评估指标如通过率难以揭示代码的深层质量属性,而Halstead复杂度与圈复杂度等指标的引入虽提供了更丰富的维度,但指标间的相互解释与权重平衡构成了方法论上的棘手难题。此外,数据集中样本量偏少(仅164条训练实例),限制了统计推断的稳健性与泛化结论的可信度,对构建普适性的代码生成评估体系构成了严峻挑战。
常用场景
经典使用场景
在代码智能与软件工程领域,该数据集经典的使用场景集中于评估与优化大语言模型在代码生成任务中的表现。具体而言,它记录了Qwen3-4B模型在特定策略(trust_t1.1_g7)下对一组编程问题的求解结果,通过包含是否可执行、测试通过数与失败数、错误类型等关键指标,为研究者提供了衡量模型生成代码正确性的直接依据。此外,数据集还纳入了Halstead复杂度、圈复杂度、可维护性指数等软件度量特征,使得研究者能够深入分析生成代码的质量属性,而不仅仅局限于功能性正确。这种多维度评估框架,使得该数据集成为审视代码生成模型能力边界的理想基准。
衍生相关工作
该数据集的出现,催生了一系列围绕代码生成质量评估的衍生工作。一方面,研究者开始利用其中的软件度量特征,训练分类器或回归模型来预测生成代码的可维护性与缺陷概率,从而开发出更智能的代码审查辅助工具。另一方面,数据集中的错误类型与预测熵信息,被用来设计自适应提示策略或奖励模型,以引导大语言模型在生成过程中主动降低不确定性,提升首次生成正确率。此外,一些工作据此构建了多任务学习框架,同时优化代码的功能正确性与结构优雅性,探索了可执行性与代码复杂度之间的权衡关系。这些衍生研究不仅丰富了代码智能领域的实验范式,也为构建更可靠、更高效的代码生成系统提供了坚实的实证基础。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化质量评估与可解释性分析,通过集成代码执行结果、复杂度指标(如圈复杂度、Halstead度量)及信息熵等多元特征,为评估模型生成代码的语法正确性、执行效率与可维护性提供了结构化基准。前沿方向包括利用预测熵与令牌分布探索模型决策的不确定性,结合可维护性指数与代码体积量化生成的代码是否符合工程实践,从而推动大型语言模型在自动编程任务中的可信度与实用性研究。
以上内容由遇见数据集搜集并总结生成



