遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,每个样本具有代码质量相关的特征,包括任务ID、入口点、可执行性、正确性、测试通过/失败数量、运行时间、错误类型、Halstead复杂度指标(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、有效代码行数、注释百分比、类型令牌比、令牌字典、香农熵、预测熵等。适用于代码质量分析、复杂性度量、可维护性评估等研究。

This dataset contains 164 training samples, each with code quality-related features including task ID, entry point, executability, correctness, number of tests passed/failed, runtime, error type, Halstead complexity metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, type-token ratio, token dictionary, Shannon entropy, predictive entropy, etc. It is suitable for research on code quality analysis, complexity measurement, maintainability assessment, etc.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run2_metrics 数据集图片
构建方式
该数据集是在代码生成模型性能评估的背景下构建的,基于Qwen3-4B模型在'master'测试集上的推理结果,采用信任策略(trust策略)并设置温度系数为1.25、生成长度为2的多次采样(run2),对生成的代码片段执行动态测试与静态分析。每个样本包含任务标识、入口函数、执行正确性标志、测试通过/失败计数、错误类型及执行时间等动态指标,同时融合了Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比、词符类型比、香农熵及预测熵等十余种代码度量特征,形成对代码质量与结构的多维度量化表征。
特点
数据集特色在于将代码的动态执行结果与静态软件度量紧密结合,提供了从测试通过率到Halstead难度、从圈复杂度到可维护性指数的全方位特征体系。共计164个训练样本涵盖了可执行性、正确性、执行效率、代码复杂度及语义多样性等关键维度,尤其通过词符字典与多种熵值指标捕捉代码的词汇丰富度与不确定性,为分析模型生成代码的鲁棒性与结构合理性提供了细粒度的评估基础。
使用方法
本数据集适用于构建代码生成模型的性能分析、代码质量预测及生成策略优化等研究任务。研究人员可直接使用'task_id'与'entry_point'匹配原始测试任务,结合'is_correct'和'tests_passed'等标签进行正确性分类或回归分析;亦可利用Halstead指标、复杂度度量及熵值特征作为输入,训练评估代码可维护性或测试充分性的辅助模型。数据集以HuggingFace Datasets格式存储,通过'load_dataset'函数加载'train'分片即可直接用于训练或评估流程。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run2_metrics,由autophagycode团队于近期创建,聚焦于代码生成模型的评估与诊断。核心研究问题在于如何通过细粒度的代码质量指标衡量大语言模型生成代码的可靠性、可维护性与执行正确性,从而推动可信赖代码生成技术的发展。数据集涵盖164个样本,每个样本包含任务标识、执行状态、Halstead复杂度、圈复杂度、可维护性指数等多维度特征,为理解模型在特定策略(如trust策略)下的行为提供了量化视角。其影响力体现在为代码智能领域的实证研究提供了标准化的评估基准,有助于揭示模型在复杂编程任务中的优势与局限。
当前挑战
该数据集所解决的领域挑战主要包括代码生成模型的评估泛化性与可信性难题:传统基于通过率的评估难以捕捉代码的语义正确性、结构复杂度及潜在缺陷,而本数据集通过多维度特征(如Halstead指标、香农熵、预测熵)试图建立更全面的评估框架。构建过程中面临的挑战包括数据样本量有限(仅164条),可能影响统计分析的稳健性;特征设计需平衡全面性与冗余性,例如token_dict等高维特征的处理方式;此外,不同代码任务间的难度差异、模型策略(trust)的调参敏感度以及环境噪声(如运行时间波动)均为确保数据集实用性的关键障碍。
常用场景
经典使用场景
在自动化代码生成与评估领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run2_metrics数据集为研究者提供了一个细粒度的模型输出质量评测基准。该数据集融合了代码可执行性、测试通过率以及多种软件工程度量指标,如Halstead复杂度、圈复杂度、可维护性指数和香农熵等,能够全面刻画代码生成模型的性能边界。经典使用场景包括评估大型语言模型在代码补全、函数生成及缺陷修复任务中的鲁棒性与泛化能力,尤其适用于对比不同温度采样策略、信任机制及模型架构对生成代码质量的影响。
实际应用
在实际应用中,该数据集可嵌入到持续集成与代码审查流水线中,辅助自动评估由AI助手生成的代码片段是否符合生产环境标准。例如,通过监控生成代码的Shannon熵与可维护性指数,开发团队能够实时筛选出结构混乱或测试覆盖率不足的候选代码,从而降低人工审查成本。此外,数据集中的测试运行时间与错误类型记录还能用于训练代码质量预测模型,为低代码开发平台和智能编程教育工具提供实时代码质量反馈,推动软件工程领域的智能化转型。
衍生相关工作
围绕该数据集已衍生出一系列富有创新性的研究工作。其中,基于Halstead难度与圈复杂度的代码复杂度预测模型被用于改进Qwen系列模型的温度调度策略,形成了动态信任阈值的生成框架。另有学者利用数据集中的token字典与预测熵特征,构建了代码生成过程的“困惑度-质量”相关曲线,揭示了模型在面对不确定任务时的自信度偏差。此外,测试通过率与可执行性标记的组合特征催生了一种新型的代码修复增强方法,通过微调策略显著提升模型在LeetCode级别问题上的修复成功率,推动了代码智能领域的理论与实践进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务