遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码分析相关特征,涵盖任务ID、入口点、可执行性、正确性、测试结果、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释比例、词汇丰富度(TTR)、令牌字典、香农熵、预测熵(均值与最大值)、函数定义数量及入口点重复性等字段。数据集包含164个训练样本,适用于代码质量评估、程序缺陷检测或软件度量分析任务。

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
该数据集源于对代码生成模型输出的系统性评估与深度分析。基于Qwen3-4B模型在特定策略(trust参数1.25,生成次数2)下生成的代码,通过自动化执行框架对每个代码样本进行编译运行,记录其可执行性、正确性及测试通过率等基础指标。在此基础上,引入Halstead复杂度、圈复杂度、维护性指数、Shannon熵等软件度量学特征,全面量化代码的静态结构、认知负荷与预测不确定性。数据集还包含词元分布与重复函数定义等高级特征,构成了多维度、细粒度的代码质量评估资源。
特点
本数据集最显著的特征在于其多维复合的代码质量评估体系。除了基础的执行正确性与测试覆盖指标外,集成了Halstead系列度量(词汇量、长度、体积、难度、工作量与时间)以刻画代码的认知复杂度,利用圈复杂度与维护性指数量化控制流复杂性,并通过Shannon熵与预测熵评估代码的统计异常性。此外,TTR(类型-词元比)与注释比例等特征提供了代码结构多样性与文档密度的视角。这些特征共同构建了一个从语法、语义到认知层面的立体化分析框架。
使用方法
适用于代码智能、软件工程与计算语言学交叉领域的多类研究任务。研究者可直接将其作为代码质量预测与程序理解的数据基础,利用Halstead与圈复杂度等特征训练回归或分类模型。同时,结合执行正确性标签与复杂度指标,可分析模型生成代码的失败模式与结构偏差。数据集还支持对比不同生成策略下的代码风格与稳健性差异,或作为基准用于评估新模型在代码可读性、可维护性方面的表现。推荐使用Python的pandas或datasets库加载数据,进行特征工程与统计建模。
背景与挑战
背景概述
该数据集由Qwen3-4B模型生成的代码执行结果评估数据构成,聚焦于自动化代码质量度量与可执行性校验的交叉领域。创建于2025年,研究团队围绕大语言模型生成代码的可靠性这一核心问题,系统性地收集了164个编程任务的执行反馈。每个样本不仅标注了代码的正确性、通过/失败测试数,还涵盖了Halstead复杂度、圈复杂度、维护性指数及Shannon熵等二十余项软件工程指标。该数据集为评估和优化语言模型的代码生成能力提供了多维度的定量基准,推动了代码智能领域从功能正确性向代码质量评估的深层延伸。
当前挑战
数据集当前面临的挑战主要体现在以下维度。首先,领域问题层面,传统代码生成评测多局限于功能正确性,而该数据集试图构建可执行性与代码质量联合评估的范式,但现有指标间存在信息冗余与解释歧义,如何从高维度量中提炼出普适的代码质量评估标准仍是难题。其次,构建过程中遇到数据稀疏性问题,164个样本量难以覆盖多样化的编程范式与错误类型,且在测试环境、函数独立性和运行时间测量的标准化上存在工程挑战,导致指标的可复现性与跨模型泛化能力受限。
常用场景
经典使用场景
在人工智能与代码生成领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run0_metrics数据集承载了代码生成模型性能评估与优化的重要使命。该数据集通过记录代码生成任务的执行结果、代码复杂度指标以及模型预测熵值,为研究者提供了衡量模型生成代码正确性、可维护性及执行效率的多维视角。其经典使用场景聚焦于对Qwen3-4B等基座模型进行微调后的细粒度评估,通过比较不同超参数设置下的代码通过率、Halstead复杂度及循环复杂度等特征,帮助研究人员精准识别模型在代码逻辑构建、错误处理及资源消耗方面的优劣势。
实际应用
在实际应用层面,该数据集为自动化代码审查系统、智能编程助手的质量监控及开发者生产力工具的优化提供了坚实的评测基准。软件工程团队可借助数据集中的执行时长、错误类型及复杂度分布,训练出能够预警潜在低效代码的过滤器;而教育科技平台则能利用任务正确性、重复定义检测等指标,构建面向学习者的代码质量反馈机制。此外,这些数据还支撑了模型在安全关键领域的部署决策,通过分析错误类型与代码复杂度的关联,降低生成代码引入运行时缺陷的风险。
衍生相关工作
基于该数据集催生了一系列具有影响力的衍生工作,包括面向代码生成模型的性能诊断框架、基于Halstead度量的代码质量预测模型,以及融合预测熵与复杂度指标的模型不确定性校准方法。这些研究借鉴了数据集中任务ID、测试通过率与代码特征之间的相关性,发展出能够在线评估生成代码鲁棒性的自适应监控策略。在可预见的未来,该数据集还将推动可解释性代码生成、复杂代码克隆检测以及基于注释密度的代码文档化改进等前沿方向的探索,成为连接代码生成理论与软件工程实践的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务