遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,用于代码质量评估和分析。每个样本代表一个代码任务,特征包括任务ID、入口点、可执行性、正确性、通过和失败的测试数量、测试运行时间(当前为空)、错误类型、Halstead复杂度指标(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、平均和最大预测熵、定义函数数量以及入口点是否重复。数据集旨在支持代码执行性能、错误检测和代码度量研究。

This dataset contains 164 training samples for code quality evaluation and analysis. Each sample represents a code task, with features including task ID, entry point, executability, correctness, number of passed and failed tests, test runtime (currently empty), error type, Halstead complexity metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, average and maximum prediction entropy, number of defined functions, and whether the entry point is duplicated. This dataset is designed to support research on code execution performance, error detection, and code metrics.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run2_metrics 数据集图片
构建方式
该数据集旨在评估代码生成模型在特定策略下的执行效果,基于autophagycode_D_he_train语料库,采用Qwen3-4B模型在信任度参数t=1.25、生成轮次g=4的配置下,结合特定策略进行代码推理与执行。每条数据记录了任务标识符、入口函数、可执行性、正确性标签、通过的测试数、失败的测试数、错误类型等执行结果指标,同时融入了Halstead复杂度度量(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、注释占比、文本重复率、词元分布及信息熵等静态代码特征,构建了一个融合动态执行反馈与静态代码分析的复合型评估数据集。
特点
数据集以164条训练样本构成,规模虽小但特征丰富,涵盖了25个维度,兼顾代码的功能正确性(如tests_passed/tests_failed)与内在质量(如圈复杂度、可维护性指数)。特别引入了Shannon熵、平均预测熵和最大预测熵等概率性度量,用于量化模型对代码生成的确定性或不确定性。此外,token_dict字段保存了词元级别的分布信息,为分析模型生成策略的词汇偏好提供了细粒度视角。这些特征使得数据集既能支持代码生成模型的性能诊断,也能用于代码复杂度与可读性的量化研究。
使用方法
该数据集以Parquet格式存储,通过HuggingFace Datasets库加载,默认配置为单个训练集分割。可直接调用`load_dataset("autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run2_metrics")`获取数据。适用于比较不同生成策略下的代码质量差异、分析模型在特定温度与轮次设定下的输出分布,或训练代码复杂度预测模型。研究者可利用其中的正确性标签与静态度量特征进行回归分析,或基于错误类型与熵值构建代码鲁棒性评估基准。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run2_metrics,创建于大语言模型与代码生成技术高速发展的时期,由研究人员基于Qwen3-4B模型对代码自动修复任务进行深入研究时构建。核心研究问题聚焦于评估模型生成代码的可执行性、正确性及代码质量,通过引入Halstead复杂度、圈复杂度、可维护性指数、香农熵等多项软件度量指标,系统性地刻画模型输出代码的语义与结构特征。该数据集在领域内具有独特价值,不仅为代码生成模型的鲁棒性评估提供了细粒度视角,更为理解大模型在编程任务中的行为模式奠定了基础,对推动可信代码生成与自动化软件工程的发展产生了积极影响。
当前挑战
当前数据集面临的核心挑战首先在于领域问题的复杂性:代码生成与修复需同时兼顾语法正确性、语义一致性及运行时效率,而现有模型在复杂逻辑推理与边界条件处理上仍存在显著短板,导致数据集中的样本错误类型多样且难以归因。其次,构建过程中的挑战体现为度量指标选取与平衡的难题——如何在丰富代码表征信息(如Halstead指标、圈复杂度)的同时避免过拟合于特定统计特征,以及如何在高维稀疏特征(如token_dict)与可解释性之间取得妥协。此外,数据集仅含164条样本,规模有限,可能不足以覆盖多样化的编程范式与错误模式,对模型泛化能力的评估构成潜在制约。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与优化,尤其适用于自噬代码(Autophagy Code)策略下的模型训练与验证。经典使用场景包括:分析模型生成的代码在可执行性、正确性及测试通过率上的表现,并借助Halstead复杂度、圈复杂度、可维护性指数等软件度量指标,深入剖析生成代码的质量与结构特征。研究者可利用该数据集对比不同策略(如trust参数调节)对模型输出代码的语义正确性与工程鲁棒性的影响,从而为代码大模型的迭代提供精细化指导。
实际应用
在实际应用中,该数据集可用于开发面向软件开发者的代码生成辅助工具,例如自动审查生成代码的圈复杂度过高或注释率不足等不良倾向,并建议重构方案。它还能赋能持续集成/持续部署(CI/CD)流水线,通过实时追踪模型输出代码的Halstead难度与认知熵,预警潜在的技术债务。此外,在编程教育场景中,数据集可帮助评估学生提交代码的可维护性与可读性,推动自动化编程辅导系统从“结果正确”向“代码健康”的全面升级。
衍生相关工作
围绕该数据集衍生了多项经典工作,包括基于Halstead度量与认知熵的代码质量预测模型,以及融合圈复杂度的代码生成前缀调优方法。研究者还构建了自噬循环生成框架(Autophagy Loop),通过反复评估模型自身生成的代码质量特征来优化训练策略,提升了代码正确性与结构优雅度的平衡。此外,该数据集催生了面向代码可维护性的对比学习方案,为后续的代码智能体风险评估与自我修正机制奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务