stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run2_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含代码执行和代码度量相关的数据,用于评估代码质量或代码生成任务。数据集包括任务ID、入口点、可执行性、正确性、测试通过/失败数量、错误类型,以及Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释比例、词汇多样性、香农熵等代码度量指标。数据集分为训练集,包含164个示例,总大小约246KB。
This dataset contains data related to code execution and code metrics, designed for evaluating code quality or code generation tasks. It includes task ID, entry point, executability, correctness, number of tests passed/failed, error type, and code metrics such as Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, type-token ratio, Shannon entropy, and predictive entropy. The dataset is split into a training set with 164 examples and a total size of approximately 246KB.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集构建于代码智能领域,专注于评测与优化代码生成模型在可执行性、正确性与复杂度维度的性能。构建流程基于Qwen3-4B模型在特定策略(strategy_trust)下,针对mercury数据集中的任务进行代码生成,并依据测试用例的执行结果与静态分析指标进行加工。每条数据包含任务标识、入口函数、可执行性、正确性状态、通过/失败测试数、运行时错误类型,以及Halstead复杂度(如词汇量、长度、体积、难度、工作量与时间)、圈复杂度、可维护性指数、代码行数、注释占比、词元比率、香农熵与预测熵等指标,构成多维评估体系。
特点
该数据集的核心特点在于将代码执行结果与十余种经典代码度量指标深度融合,形成一个全面的代码质量画像。特别引入了token_dict与多种熵值(香农熵、均值预测熵及最大预测熵),从信息论角度刻画代码的复杂性与不确定性。此外,还记录了函数定义数量与入口点重复性,便于分析任务重复度。通过is_executable和is_correct两个布尔字段,可以快速筛选出可运行且正确的样本,为后续的模型微调或鲁棒性分析提供精准子集。
使用方法
该数据集适用于代码生成模型的性能评估与微调研究。用户可通过task_id与entry_point字段定位具体任务,利用is_executable与is_correct字段过滤有效样本,再结合tests_passed和tests_failed评估生成代码的准确率。代码复杂度指标如Halstead度量与圈复杂度,可用于分析模型在不同难度任务上的表现差异。数据集以HuggingFace Datasets标准格式提供,仅包含训练集,共164条样例,可直接加载使用并支持基于Python的后续统计分析或模型对比实验。
背景与挑战
背景概述
该数据集由研究人员基于大语言模型代码生成能力评估需求构建,创建于2025年。其核心研究问题聚焦于如何系统性地量化代码生成模型在复杂编程任务中的执行正确性与代码质量。通过整合执行测试结果与Halstead复杂度、圈复杂度、可维护性指数等软件工程指标,数据集为代码智能领域提供了多维度评估基准。对推动大语言模型在自动化编程、软件测试等场景的可信部署具有重要参考价值。
当前挑战
数据集面临的挑战首先在于其所解决的领域问题:现有代码生成评估多依赖单一正确性指标,难以全面反映模型在鲁棒性、可维护性及执行效率上的综合表现,亟需建立融合执行测试与代码质量度量的标准化评估框架。构建过程中的挑战则表现为数据标注的复杂性——需精确记录每次执行的测试通过/失败详情、运行时错误类型及代码度量元,同时确保小样本场景下维度间关联分析的可靠性,这对数据采集流程的自动化与精准性提出极高要求。
常用场景
经典使用场景
在代码智能与软件工程领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run2_metrics数据集以其丰富的复杂度度量与执行状态标注,成为评估和训练代码生成与修复模型的经典基准。研究者常利用该数据集中的任务唯一标识、入口函数、执行正确性标志、测试通过与失败计数,以及Halstead复杂度、圈复杂度、可维护性指数等软件度量指标,深入剖析模型生成代码的功能正确性与代码质量。该数据集为对比不同策略下(如信任策略、温度参数)生成的代码片段提供了标准化评估框架,尤其适用于分析大型语言模型在特定参数配置下的代码产出特性。
实际应用
在实际工业场景中,该数据集可助力企业级代码生成工具的迭代优化。软件开发团队可利用其中真实代码片段及其细粒度执行状态,对基于大语言模型的代码补全与修复服务进行效果评估。例如,通过分析不同信任阈值下生成的代码复杂度差异,可调整模型部署策略以平衡生成速度与产出质量。此外,该数据集中的执行时间与错误类型字段,为持续集成流水线中代码审查和自动化测试的智能决策提供了参考,有助于构建更高效的辅助编程环境。
衍生相关工作
依托该数据集的丰富标注信息,已衍生出若干前沿研究方向:基于复杂度的代码生成质量预测模型,利用Halstead指标与圈复杂度作为特征输入,预测代码的可维护性;执行状态感知的代码修复策略,结合测试通过/失败结果与错误类型,训练模型实施针对性缺陷定位与修正;以及代码生成策略的自动化调优框架,通过分析不同温度参数与信任阈值下的度量分布,探索最优生成配置。这些工作共同拓展了数据集在研究单位内外的应用边界,促进了代码生成领域从单一正确性评价到多维质量评估的深化发展。
以上内容由遇见数据集搜集并总结生成



