遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码分析相关的特征,用于评估编程任务的执行和复杂度。具体特征包括任务ID、入口点、可执行性、正确性、通过和失败的测试数量、测试运行时间(当前为空)、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释比例、类型标记比(TTR)、令牌字典、香农熵、平均预测熵、最大预测熵、定义函数数量以及入口点是否重复。数据集包含一个训练分割,共有164个示例,适用于代码质量分析、机器学习模型训练或编程教育研究。

This dataset includes features related to code analysis for evaluating the execution and complexity of programming tasks. Specific features include task ID, entry point, executability, correctness, number of tests passed and failed, test run time (currently null), error type, Halstead complexity metrics (such as vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and whether the entry point is repeated. The dataset contains a training split with 164 examples, suitable for code quality analysis, machine learning model training, or programming education research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run1_metrics 数据集图片
构建方式
该数据集以Qwen3-8B模型作为基座,针对编程任务生成代码后,系统性地采集了多维度执行与质量指标。构建过程涵盖代码执行验证(如is_executable与is_correct字段)、测试通过率(tests_passed与tests_failed)及运行耗时(test_run_time_ms),同时引入Halstead复杂度度量体系(包括词汇量、长度、体积、难度等)与McCabe圈复杂度、可维护性指数等软件工程度量,辅以词频与熵值等语义特征,形成对代码质量的全方位表征。
特点
数据集特色在于融合程序执行动态指标与静态代码复杂度特征,共计22个字段,形成从可执行性、正确性到代码内在结构的立体刻画。其中,Halstead系列指标与圈复杂度能够揭示代码的认知负荷与逻辑复杂性,而Shannon熵与预测熵则从信息论角度捕捉代码的不确定性与多样性。164条训练样本虽规模有限,但每例均包含token_dict等细粒度数据,为代码生成质量评估提供了多视角的分析基础。
使用方法
数据集适用于训练代码质量评估模型或分析大语言模型生成代码的特性。用户可直接加载train拆分,利用is_correct及tests_passed作为监督信号,结合Halstead复杂度与可维护性指数等特征进行回归或分类任务。亦可借助token_dict与熵值特征开展生成代码的分布分析,或通过error_type字段诊断模型常见错误模式。建议在加载后对test_run_time_ms等含空值字段进行预处理,以提高模型训练的稳健性。
背景与挑战
背景概述
该数据集由autophagycode研究团队基于Qwen3-8B模型,采用mercury策略在信任度阈值1.25与生成轮次3的参数配置下构建,专注于代码生成任务中的质量评估与可执行性验证。核心研究问题聚焦于如何通过复杂度度量与熵值指标量化生成代码的鲁棒性与可信度。数据集中包含Halstead复杂度、圈复杂度、维护指数及香农熵等20余项特征,为代码智能领域提供了细粒度的评估基准。该工作在自动编程与软件工程交叉领域具有前沿探索价值,通过量化生成代码的词汇多样性、逻辑复杂度与可维护性,推动了代码质量自动化评估技术的发展。
当前挑战
当前面临的核心挑战包括:一是代码生成领域普遍存在的可执行性与正确性难以兼顾的问题,数据集中仅164条样本且存在大量非可执行代码,反映了模型生成代码的语义正确性瓶颈;二是构建过程中需面对多维度质量指标的整合困境,如环复杂度与维护指数在短样本中的区分度不足,以及token字典与熵值特征在高维稀疏空间下的解释性挑战;三是数据集规模受限,小样本特征分布可能无法充分覆盖现实场景中代码逻辑的多样性,制约了评估结果的泛化能力与置信度提升。
常用场景
经典使用场景
该数据集汇聚了代码生成模型在特定编程任务上的执行结果与多维度的软件度量指标,为评估与优化代码生成模型的鲁棒性与正确性提供了珍贵的基准资源。典型应用场景包括:通过将模型生成的代码与真实解决方案进行功能比对,分析代码在可执行性、测试通过率等关键维度上的表现,从而衡量生成模型在复杂编程场景下的泛化能力与可靠性。此外,数据集整合了哈尔斯特德复杂度、圈复杂度、可维护性指数等软件工程领域的经典度量标准,使得研究者能够深入剖析模型生成代码的结构质量与可读性,进而揭示不同训练策略对代码综合品质的影响机制。
实际应用
在实际开发与工程实践中,该数据集为代码智能辅助工具的持续优化提供了数据驱动的决策支撑。开发团队可依托数据集中的度量分布,设计平衡代码正确性、复杂性与可维护性的多目标优化策略,从而在自动化代码生成、补全与修复工具中实现更贴合真实软件工程需求的输出。数据集中的错误类型与失败模式分析还可引导构建故障诊断与异常处理机制,提升生成代码在持续集成、自动化测试等工业级场景中的稳定性与可靠性,最终降低人工审查与调试的工作负担,加速软件开发迭代周期。
衍生相关工作
该数据集的发布催生了一系列前沿研究方向,包括但不限于:基于哈尔斯特德与圈复杂度等度量特征的可预测性建模工作,旨在提前预估生成代码的测试通过概率与潜在错误类型;融合软件度量信息的代码质量排序与过滤算法,用于在多个候选生成结果中自动筛选最优方案;以及探究训练策略(如温度参数、可信度阈值)对代码复杂度、可维护性指标影响的因果分析研究。此外,该数据集还促成了跨模型架构的代码质量对比基准,为后续研究者在不同规模、不同训练方法的代码生成模型之间进行公平且全面的性能评估提供了标准化平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务