遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,主要用于代码分析和编程任务评估。每个示例包含多个特征,如任务ID(task_id)、代码入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过和失败数量(tests_passed、tests_failed),以及代码复杂度指标(如Halstead度量、循环复杂度、可维护性指数、代码行数LOC、注释比例等)。此外,还包括词汇多样性(TTR)、信息熵(shannon_entropy)和预测熵等统计特征。数据集旨在支持代码质量评估、自动化测试和程序分析研究。

This dataset contains 164 training examples, primarily designed for code analysis and programming task evaluation. Each example includes multiple features such as task ID (task_id), code entry point (entry_point), executability (is_executable), correctness (is_correct), number of tests passed and failed (tests_passed, tests_failed), and code complexity metrics (e.g., Halstead measures, cyclomatic complexity, maintainability index, lines of code LOC, comment percentage). Additionally, it incorporates statistical features like type-token ratio (TTR), Shannon entropy, and predictive entropy. The dataset aims to support code quality assessment, automated testing, and program analysis research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run0_metrics,源于代码生成与评估领域,旨在系统性地度量大规模语言模型在代码补全任务中的生成质量与代码属性。数据集构建基于Qwen3-4B模型在特定策略(trust策略,温度参数t1.1,生成轮次g8)下对训练分片(train-mercury)的推理结果,通过自动化执行管道,记录了每段生成代码的测试通过率、运行时间、错误类型等执行指标,同时纳入了Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释比例、词汇多样性(TTR)及香农熵等静态代码度量,形成了从执行到语义的多维度评估体系。
特点
数据集包含了164条训练样本,涵盖34个精细特征,结构丰富而系统。核心特色在于将动态执行结果(如测试通过/失败数、运行时长)与静态代码质量指标(如Halstead难度与工作量、圈复杂度、可维护性指数)深度融合,能够全面刻画代码的功能正确性与结构可读性。此外,数据集引入了Shannon熵和预测熵等信息论度量,从信息不确定性角度补充了代码质量评估维度,为理解模型生成代码的可预测性与复杂性提供了独特视角。每个样本还记录了函数定义数量与入口点重复情况,便于分析生成代码的模块化与冗余程度。
使用方法
数据集以HuggingFace格式存储,包含一个名为'train'的分割,数据文件位于'data/train-*'路径下,总大小为247729字节。用户可通过HuggingFace的datasets库直接加载,例如使用load_dataset函数指定数据集名称和配置项'default'即可获取包含所有特征的DataFrame。数据适用于多种下游任务,如训练代码质量预测模型、分析不同温度参数下模型生成行为的差异,或作为代码复杂度与正确性关系的基准测试集。建议在加载后对空值字段(如test_run_time_ms)进行预处理,并根据研究目标筛选特征子集进行统计分析或机器学习建模。
背景与挑战
背景概述
该数据集由研究团队在近期构建,旨在评估代码生成模型在自动编程任务中的性能与可靠性。其核心研究问题聚焦于代码正确性、执行效率及代码质量的多维量化分析。通过整合Halstead复杂度、圈复杂度及维护性指数等软件工程度量指标,该数据集为衡量生成代码的结构复杂度和可维护性提供了标准化参照。数据集虽规模有限(仅164个训练样本),但因其丰富的特征维度,在代码智能领域具有重要价值,有助于推动模型生成代码的鲁棒性和人类编程规范一致性研究。
当前挑战
当前数据集面临的首要挑战在于代码生成模型常输出虽通过测试但结构臃肿、缺乏可维护性的解决方案,如何平衡执行正确性与代码质量的评估是一大难题。其次,构建过程中需应对代码可执行性判定的非确定性(如环境依赖导致的测试失败)与复杂度指标的精准提取,尤其针对不同编程范式下Halstead指标的有效性进行验证。此外,小样本规模限制了模型泛化能力的深度评估,而代码克隆检测与认知熵等新兴指标的纳入仍缺乏领域共识,对数据集的标准化扩展构成挑战。
常用场景
经典使用场景
在代码生成与自动程序修复领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run0_metrics数据集通过记录模型生成代码的测试通过数、失败数及运行时性能,为评估生成代码的正确性提供了量化基准。其丰富的Halstead复杂度指标和圈复杂度特征,使其成为研究代码可维护性与生成质量的经典数据集,常用于对比不同代码生成策略的优劣。
实际应用
在实际应用中,该数据集可用于构建智能编程辅助系统的评测基准,帮助开发者筛选出高可靠性的代码生成模型。基于其包含的可执行性判断与测试运行时间信息,企业可将其作为自动化代码审查工具的核心评估数据,量化模型在实际部署环境中的性能表现,从而优化软件开发生命周期中的代码质量保障流程。
衍生相关工作
该数据集衍生了多项关于代码生成策略的对比研究,特别是在探索信任度阈值与模型规模对生成质量的影响方面。相关工作包括基于Halstead复杂度预测代码可维护性的回归模型,以及利用圈复杂度和香农熵分析模型预测不确定性的工作。此外,研究者还将其与执行结果结合,开发了针对错误类型的分类框架,推动了代码生成中鲁棒性分析的深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务