遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,主要用于代码分析或软件工程任务。它提供了多种代码质量指标,如任务ID、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间、错误类型、Halstead复杂度度量(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、标记字典、香农熵、平均预测熵、最大预测熵、定义函数数量以及入口点重复性。数据集大小为241,052字节,下载大小为102,641字节。

This dataset contains 164 training examples and is designed for code analysis or software engineering tasks. It includes various code quality metrics such as task ID, entry point, executability, correctness, tests passed/failed, test run time, error type, Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and entry point repetition. The dataset size is 241,052 bytes with a download size of 102,641 bytes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run0_metrics,聚焦于代码生成与评估领域,由大规模语言模型在特定策略下生成的代码样本后,经自动化执行与代码质量分析工具处理而成。构建过程中,首先为每个编程任务分配唯一标识符及入口函数,随后执行生成代码并记录其通过率、失败测试数及运行耗时;同时,对生成的代码进行复杂度分析,提取Halstead度量(如词汇量、长度、体积、难度、工作量、时间)、循环复杂度、可维护性指数、代码行数、注释比例等指标,并结合词频-逆文档频率及预测熵等语言模型特征。最终形成一个包含164个训练样本的小规模、多维度的代码质量评估数据集。
特点
数据集显著特点在于其多维融合的评估视角。除了传统的执行正确性(如is_correct、tests_passed)外,还纳入了代码可维护性指标(如maintainability_index)与复杂度指标(如cyclomatic_complexity),从“功能正确”与“代码健康”两个维度对生成代码进行量化。此外,通过引入Halstead度量、香农熵及预测熵等特征,数据集将程序语言的结构特性与语言模型的不确定性结合在一起,为分析模型生成代码的质量、稳定性与可解释性提供了丰富的数据支持。数据规模虽有限,但特征空间完整,适合探索小样本下的评估方法。
使用方法
本数据集适用于训练或测试代码质量预测模型、代码评估器或自动化代码审查系统。用户可选择将任务标识(task_id、entry_point)与正确性标签(is_correct)作为监督学习的目标变量,利用其余所有数值型与布尔型特征构建机器学习模型。在训练前,建议对诸如test_run_time_ms等存在空值的字段进行填充或剔除;对于token_dict等字符串特征,可进一步解析为向量输入。数据集的单一训练集划分(164条记录)主要适用于小样本学习场景或作为基准评估集的子集进行交叉验证。
背景与挑战
背景概述
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run0_metrics,由研究团队在代码智能与软件工程领域构建,旨在评估大语言模型在自动代码生成任务中的表现。数据集包含164个训练样本,记录了每个代码任务的执行正确性、测试通过率、错误类型以及多项软件度量指标(如循环复杂度、Halstead复杂度、可维护性指数等)。这些度量从代码的结构、体积、可读性和熵等维度,为量化分析模型生成代码的质量提供了多维特征。该数据集聚焦于研究代码生成模型在复杂编程问题上的可靠性、可维护性和执行效率,对推动代码智能评估体系的标准化具有重要价值。
当前挑战
该数据集面临的挑战主要来自两方面。其一,代码生成领域长期存在评估指标单一的问题,传统方法仅关注功能正确性,忽视了代码的可维护性、计算复杂性及信息熵等关键质量维度,该数据集通过引入Halstead复杂度、香农熵等度量,试图构建更全面的评估框架,但如何对这些多维指标进行有效融合与加权仍是一个难题。其二,数据集构建过程中,由于需从模型生成结果中自动提取并计算大量软件度量指标,如词法分析、控制流计算和熵值估算,对预处理管道的精度和鲁棒性提出了极高要求,少量噪声或不兼容的编程风格可能导致度量偏差,影响后续分析结论的可靠性。
常用场景
经典使用场景
在代码智能与软件工程领域,该数据集为评估大语言模型生成的代码质量提供了精密的度量基准。它整合了Halstead复杂度、圈复杂度、可维护性指数、香农熵等二十余项软件度量指标,使得研究者能够从词法多样性、结构复杂性、执行正确性等维度对模型输出进行多角度剖析。其经典使用场景在于量化分析不同推理策略(如本数据集中体现的trust策略与温度参数调控)对代码生成质量的影响,为理解生成式模型在编程任务中的行为模式奠定数据基础。
解决学术问题
该数据集直面当前大语言模型代码生成领域的关键学术难题——如何系统性地评估生成代码的软件工程属性。它突破了传统仅依赖功能性测试(如测试通过率)的局限,引入可维护性指数、预计耗时、预测熵等一系列专业度量,使研究人员能够深入探讨模型输出与人类编写的可维护、可理解代码之间的距离。这一多维评估框架有力地推动了代码生成质量评价从单一正确性标准转向更加全面的软件质量维度,对于理解大模型在自动化编程中的实际效能具有里程碑式的意义。
衍生相关工作
围绕该数据集的度量框架,衍生出多方面富有深度的研究工作。一方面,它催生了基于可维护性指数的代码生成质量预测模型,利用回归分析探究测试通过率与结构复杂度之间的隐式关联;另一方面,其丰富的词法统计特征(如类型-词符比、香农熵)启发了面向大模型生成结果的代码风格一致性检测算法。此外,该数据集作为桥梁,连接了传统软件度量学与当代大语言模型评估两个领域,为后续构建融合功能正确性与结构优雅性的复合评分系统提供了宝贵的基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务