遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务的执行和代码度量数据,用于分析和评估代码质量。数据集包括任务ID、执行入口点、可执行性状态、正确性标志、测试通过和失败数量、测试运行时间(当前为空)、错误类型,以及多个代码复杂度指标(如Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数),同时涵盖代码行数(LOC和SLOC)、注释百分比、词汇多样性(TTR)、词汇字典、香农熵、预测熵均值和最大值,以及定义函数数量。数据分为训练集,包含164个样本,总大小约224KB,适用于代码质量评估、自动化测试或程序分析研究。

This dataset contains execution and code metric data for programming tasks, designed for analyzing and assessing code quality. It includes fields such as task ID, entry point, executability status, correctness flag, number of tests passed and failed, test run time (currently null), error type, and various code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time; cyclomatic complexity; maintainability index). Additionally, it covers lines of code (LOC and SLOC), comment percentage, vocabulary diversity (TTR), token dictionary, Shannon entropy, mean and maximum predictive entropy, and number of defined functions. The data is split into a training set with 164 examples and a total size of approximately 224KB, suitable for research in code quality evaluation, automated testing, or program analysis.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run1_metrics 数据集图片
构建方式
该数据集基于代码生成大模型Qwen3-8B在推理策略'mercury'下的执行反馈构建而成。具体而言,从'autophagycode_D_he_train'基准测试集中选取编程任务,模型通过temperature为1.25、top_p为9.0的生成策略产出代码,并经由测试用例运行、静态代码度量与预测熵计算等多维度管线,系统化地采集了每个样本的执行正确性、运行时性能与代码复杂度等结构化信息。
特点
数据集融合了执行动态指标与代码静态特征两大维度的丰富信息。不仅记录了每个编程任务的测试通过数、失败数及运行时错误类型,还涵盖了Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比等经典软件度量,并创新性地引入了词符级香农熵和预测熵,使其能够支持对模型生成代码的质量、可读性与不确定性进行多层次剖析。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,默认配置为'train'分片,含164个样本。适用于分析代码生成模型的错误模式与鲁棒性,或构建代码质量预测、复杂度估算等机器学习任务。推荐结合'is_correct'、'error_type'等字段进行监督学习,也可利用熵特征探索模型在面对不同难度编程任务时的置信度差异。
背景与挑战
背景概述
该数据集由autophagycode团队创建,旨在评估代码生成模型(如Qwen3-8B)在特定策略下的执行效能。数据集聚焦于程序合成领域,通过记录任务ID、入口点、可执行性、正确性、测试通过/失败次数及多项代码度量指标(如Halstead复杂度、循环复杂度、可维护性指数、香农熵等),为模型生成的代码提供多维度的质量评估。该研究可追溯至近年来大语言模型在代码生成任务中的广泛应用,其核心问题在于如何量化生成代码的可靠性、可维护性与功能性。数据集仅包含164个训练样本,但提供了丰富的代码静态度量信息,为后续代码智能研究奠定了基准。
当前挑战
该数据集面临的首要挑战是样本规模较小(仅164例),可能限制模型泛化能力的评估与鲁棒性分析。在构建过程中,需解决代码执行环境的稳定性与测试覆盖率的完整性,确保每条生成的代码均可被准确验证。此外,代码度量指标(如Halstead难度与易理解度)的自动化计算需依赖解析器的准确率,错误解析将导致特征噪声。数据集的标注依赖于人工或启发式规则定义正确性,但复杂逻辑代码的正确性判定可能存在歧义。最后,缺失测试运行时间等关键字段(为空值)给性能评估带来困难,需设计插补或基于特征相近的推断策略以补全信息。
常用场景
经典使用场景
在代码智能与软件工程领域,该数据集主要用于评估大语言模型(LLM)在代码生成任务上的执行正确性与代码质量,尤其是在HuggingFace的信任评估策略下,通过多维度指标(如测试通过率、Halstead复杂度、圈复杂度、可维护性指数等)对模型生成的代码进行细粒度分析。经典使用场景包括:对比不同模型在相同任务上的代码正确性与鲁棒性,以及探究代码复杂度与测试通过率之间的关联。
解决学术问题
该数据集解决了代码生成评测中仅关注功能正确性而忽视代码质量与可维护性的问题。通过引入Halstead复杂度、圈复杂度、可维护性指数等超过20项代码质量指标,为学术研究提供了评估模型生成代码的结构化、可量化标准。其意义在于推动了代码生成研究从“能否运行”向“是否高质量、易维护”转变,深刻影响了代码智能领域对模型输出进行多维度、全方面评估的方法论。
衍生相关工作
该数据集衍生的工作集中在代码复杂度预测与生成模型改进上。研究者基于其提供的圈复杂度和Halstead指标,构建了代码质量预测模型,实现了对LLM生成代码的提前预警。同时,相关工作利用该数据集训练强化学习奖励模型,引导代码生成模型在保持正确性的同时降低复杂度,涌现出如DeepSeek-Coder、CodeLlama等模型在代码质量优化方面的改进版本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务