遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含与代码任务执行和代码质量分析相关的数据,涉及任务ID、入口点、可执行性、正确性、测试通过/失败数量、代码复杂度度量(如Halstead指标、圈复杂度)、可维护性指数、代码行数、注释比例、信息熵等特征。数据集用于评估编程任务的执行结果和代码质量指标。

This dataset contains data related to code task execution and code quality analysis, including task ID, entry point, executability, correctness, number of tests passed/failed, code complexity metrics (such as Halstead metrics, cyclomatic complexity), maintainability index, lines of code, comment percentage, entropy, and other features. The dataset is used to evaluate the execution results of programming tasks and code quality metrics.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run1_metrics 数据集图片
构建方式
本数据集源于代码生成与评估流程,旨在为编程任务的自动化验证提供结构化支持。其构建基于autophagycode_D_he_train-mercury项目,采用Qwen3-4B模型在策略trust_t1.1_g3_run1框架下生成的代码结果,经过多维度指标采集与整理形成。数据集包含164个训练样本,每个样本围绕特定编程任务(task_id)构建,记录了代码是否正确执行(is_correct)、通过测试数量(tests_passed)与失败数量(tests_failed)、运行时间(test_run_time_ms)及错误类型(error_type)等关键信息。此外,还纳入了Halstead复杂度系列指标(如词汇量、长度、难度、工作量)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc与sloc)及注释比例(comment_percentage),以及基于熵的预测不确定性度量,构建了一个全面反映代码质量与复杂度的评估体系。
特点
该数据集的核心特色在于其多维度的代码质量与复杂度刻画能力。除了基础的执行正确性与测试结果外,Halstead指标从软件科学角度量化了代码的词汇丰富度与开发工作量,而圈复杂度与可维护性指数则提供了结构层面的可理解性评估。特别地,数据集引入了词元多样性(TTR)、香农熵(shannon_entropy)、平均预测熵(mean_predictive_entropy)与最大预测熵(max_predictive_entropy),这些基于信息论的度量揭示了代码模式的可预测性与随机性,为理解模型生成行为提供了新颖视角。此外,token_dict字段存储了详细的词元分布,便于深入分析。数据集结构紧凑,仅包含训练集分割,大小约237KB,适合研究与实验环境下的快速加载与迭代。
使用方法
数据集采用HuggingFace Datasets库的标准格式,可通过load_dataset()函数直接加载,默认配置为default,数据文件位于data/train-*路径下。加载后,用户可方便地遍历样本,利用字段如task_id进行任务筛选,结合is_correct、tests_passed等字段评估代码正确性,或借助Halstead、圈复杂度、熵等指标进行代码质量分析。为使用数据集,需安装datasets库,并确保Python环境支持。数据集的紧凑规模(164样本)适合作为小样本学习、代码生成评估或代码质量预测任务的基准。建议用户根据具体研究目标,有选择地提取特征,例如将信息熵指标与测试通过率联合分析,以探索代码结构复杂性对生成代码可靠性的影响。
背景与挑战
背景概述
该数据集创建于近期,由 autophagycode 团队与 Qwen3-4B 模型协作产出,聚焦于代码生成任务中模型行为与代码质量指标的量化分析。核心研究问题在于探究生成代码的可执行性、正确性以及复杂度、可维护性等多维特征。通过引入 Halstead 复杂度、圈复杂度、维护指数等软件工程经典度量,结合香农熵、预测熵等信息论指标,构建了针对模型生成代码的细粒度评估基准。该数据集对代码智能、自动化软件工程以及大语言模型评估领域具有重要影响力,为理解模型生成的代码质量与可信性提供了实证基础。
当前挑战
当前该数据集主要面临两大挑战:第一,所解决的领域问题在于代码生成评估缺乏统一的多维度量化标准,传统仅依赖通过率的评测难以反映代码的可维护性、复杂度和信息结构,而该数据集通过引入 Halstead 复杂度与熵等指标,试图弥补这一空白。第二,构建过程中的挑战表现为数据样本规模较小(164条),难以支撑大规模统计分析的可靠性,同时需确保各指标在不同编程语言或任务类型间的可比性,以及自动化提取代码特征时对边界情况的鲁棒性处理。
常用场景
经典使用场景
该数据集汇聚了代码执行结果与多维静态代码度量指标,经典使用场景聚焦于评估与优化大型语言模型(如Qwen3-4B)在程序合成任务中的表现。研究者可利用任务ID、入口函数及测试通过/失败计数,结合圈复杂度、Halstead复杂度等软件工程度量,深入剖析模型生成代码的功能正确性与结构健壮性。这一设计使得数据集成为验证模型在自动编程、算法生成等场景下可靠性的有力工具,尤其适用于探究模型行为背后的代码质量驱动因素。
解决学术问题
数据集破解了长期困扰学术界的难题:如何系统性地量化语言模型生成代码的准确性、效率与可维护性之间的权衡关系。通过融合执行结果(如测试用例通过率、错误类型)与静态分析指标(如维护性指数、香农熵),学者可首次在细粒度上探究模型预测熵与代码复杂度之间的内在关联,推动可解释人工智能在代码生成领域的发展。其对自动化软件测试与程序修复研究的深化具有重要意义,为构建更透明、鲁棒的生成式模型奠定了数据基础。
衍生相关工作
该数据集衍生出一系列前沿工作,包括基于Halstead复杂度的模型预测置信度校准研究,以及利用TTR与Shannon熵改进代码检索系统的语义相似性度量。更具启发性的是,维护性指数与圈复杂度的联合分析催生了面向大语言模型的代码重构建议框架,而错误类型的统计分布则被成功应用于训练动态测试补丁生成器。这些衍生成果不仅拓展了数据集在软件度量与机器学习交叉领域的应用边界,更推动了可量化的代码生成评价体系的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务