遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,每个样本代表一个代码任务,具有多个特征字段,用于评估代码质量。特征包括任务ID、入口点、可执行性、正确性、测试通过和失败数、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型标记比)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量以及入口点重复标志。数据集可能用于代码分析、机器学习模型训练或代码质量预测任务。

This dataset contains 164 training samples, each representing a code task with multiple feature fields for code quality assessment. Features include task ID, entry point, executability, correctness, tests passed and failed, error type, Halstead complexity metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, predictive entropy (mean and max), number of functions defined, and entry point repetition flag. The dataset is likely used for code analysis, machine learning model training, or code quality prediction tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run0_metrics,源自对代码生成模型输出质量的系统性评估。构建过程首先依托Qwen3-4B模型在trust策略框架下生成代码片段,随后对这些代码进行自动化执行与测试,记录每个代码单元的执行状态、正确性及测试通过率等基本指标。在此基础上,进一步引入Halstead复杂度度量体系,从词汇量、长度、体积、难度、工作量及时间等多维度量化代码的静态属性;同时计算圈复杂度与可维护性指数,以评估代码结构的复杂程度。还包含行数、注释比例、词符比、香农熵、预测熵等特征,并标记函数定义数量与入口点重复性,形成对代码质量与生成特性的全面刻画。
特点
该数据集的核心特点在于融合了代码执行的动态结果与多种软件度量指标,为分析代码生成模型的行为提供了多层次视角。164条训练样本虽规模有限,但每一条均携带执行正确性、测试通过数等关键标签,便于监督学习任务的开展。丰富的Halstead指标和圈复杂度等信息,使研究者能够深入探究模型生成代码的复杂度分布与可维护性特征。此外,词符比、香农熵等语言统计量有助于从信息论角度理解模型输出的不确定性。入口点重复性标记与错误类型记录,则进一步支持对模型常见失误模式的分类与诊断,为改进代码生成策略提供了实证基础。
使用方法
该数据集适用于代码生成模型的评估与改进研究,可直接用于训练分类器以预测代码正确性,或作为回归任务预测测试通过率、执行时间等连续变量。特征向量包含多种度量指标,研究者可将其作为输入,学习模型输出质量与代码结构特征间的映射关系。同时,数据集可用于分析不同置信度阈值下的模型表现,例如基于trust策略的样本筛选效果。由于数据规模较小,建议结合交叉验证或集成学习方法以提升结果稳健性。此外,错误类型与复杂度指标的组合分析,可辅助识别生成失败原因,指导提示工程或模型微调策略的设计。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,旨在评估大型语言模型在代码生成任务中的可靠性与质量。核心研究问题聚焦于如何量化模型生成代码的语义正确性、执行效率及可维护性,尤其关注模型在信任与安全场景下的表现。数据集包含164个训练样本,涵盖多种代码质量指标,如圈复杂度、Halstead复杂度、可维护性指数及香农熵等,为代码合成领域提供了细粒度的评估基准。其出现填补了当前缺乏针对模型生成代码进行多维度质量度量的空白,对推动可信代码生成技术的发展具有重要价值。
当前挑战
当前挑战主要包括三个方面:其一,数据集规模较小(仅164条),可能限制模型泛化能力的评估;其二,构建过程中需精确提取代码的多种静态属性(如语法复杂度、词汇多样性)与动态属性(如测试通过率、运行时性能),这要求复杂的执行框架与指标计算流程;其三,衡量模型生成代码的可靠性涉及执行正确性、测试覆盖率与代码可维护性的权衡,如何在单一评估体系中整合这些异构指标是一大难点,且不同错误类型(如执行错误、逻辑错误)的界定标准尚未统一。
常用场景
经典使用场景
在代码生成与软件工程领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run0_metrics数据集为评估代码生成模型在功能性、正确性和代码质量方面的表现提供了多维度的量化指标。该数据集集成了任务标识、可执行性判定、测试通过率、运行时间以及错误类型等核心信息,使得研究者能够全面衡量模型生成代码的准确性与效率。借助Halstead复杂度、圈复杂度和可维护性指数等软件度量标准,该数据集还支持对生成代码的结构复杂度与可维护性进行深入分析。经典使用场景包括对比不同代码生成策略(如信任策略)的性能,以及探索模型规模与生成代码质量之间的关联,为代码智能领域的实验基准提供了坚实的数据基础。
解决学术问题
该数据集直击代码生成领域长期存在的一个学术难题:如何系统性地评估生成代码的功能正确性与内在质量。传统的评估方式往往仅依赖简单的测试通过率,忽略了代码的可读性、复杂度和可维护性等关键指标。本数据集通过引入Halstead复杂度、圈复杂度、可维护性指数以及香农熵等细腻度量,构建了一个从功能性到结构品质的全方位评估框架。它有效解决了学术研究中评估标准单一化的问题,使得研究者能够深入剖析不同代码生成模型在生成可维护、可理解代码方面的能力差异。这一贡献推动了代码智能评估范式的演进,促使学界从简单正确性验证转向更加注重代码内在质量的综合评价。
衍生相关工作
基于该数据集,衍生出了一系列聚焦于代码质量预测与生成策略优化的前沿工作。研究者利用其中的Halstead度量与可维护性指数构建了代码可读性预测模型,旨在提前识别低质量代码片段并引导模型修正生成行为。同时,数据集中细致的错误类型分布信息催生了对错误模式分类的研究工作,进一步推动了针对特定错误类型的代码修复策略开发。在信任策略的启发下,相关团队探索了可靠性权重分配机制,将评估指标直接融入生成流程,显著提升了模型输出代码的一致性与鲁棒性。这些衍生工作不仅拓展了数据集的应用边界,也为代码智能领域注入了新的研究活力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务