遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个编程任务相关的数据集,包含164个训练样本,每个样本具有多项特征,如任务ID、入口点函数、可执行性、正确性、测试通过/失败数、错误类型、代码复杂度度量(Halstead词汇量、长度、体积、难度、努力度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、标记字典、香农熵、预测熵均值/最大值、定义函数数量以及入口点重复性。这些特征用于分析和评估代码质量、可维护性和测试性能。数据集未提供具体应用场景或来源描述,但基于特征推断可能用于代码分析或机器学习任务。

This dataset is related to programming tasks, containing 164 training examples, each with multiple features such as task ID, entry point function, executability, correctness, number of tests passed/failed, error type, code complexity metrics (Halstead vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean/max predictive entropy, number of functions defined, and entry point repetition. These features are used for analyzing and evaluating code quality, maintainability, and test performance. The dataset does not provide specific application scenarios or source descriptions, but based on the features, it may be intended for code analysis or machine learning tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run1_metrics,其构建源自对大型语言模型Qwen3-4B在代码生成任务中输出的系统性评估。数据集针对'Strategy Trust'策略下的五次运行(run1)结果进行收集,涵盖了164个训练样本。每条记录不仅包含基础的代码执行正确性(如is_correct、tests_passed与tests_failed)和运行时间(test_run_time_ms),还深度融合了Halstead复杂度指标(如词汇量、长度、难度与耗时)、圈复杂度(cyclomatic_complexity)及可维护性指数(maintainability_index)等软件工程度量。此外,数据集纳入代码层面的结构化特征,如代码行数(loc、sloc)、注释占比(comment_percentage)、标记多样性(TTR)以及信息论指标(香农熵与预测熵),构建了一个多维度的代码质量与行为画像。
特点
本数据集最具特色的地方在于其将代码可执行性评估与软件复杂度分析有机融合。与传统仅关注正确性的代码数据集不同,它提供了从文本熵(如shannon_entropy和mean_predictive_entropy)到函数定义数量(n_func_defined)的细粒度指标,能够揭示模型生成代码在语法结构、复杂度分布及信息含量层面的深层特性。独特之处还包括对入口点重复性(entry_point_repeated)的记录,这有助于识别模型是否倾向于重复生成同质化解决方案。同时,错误类型(error_type)的分类标注使得研究者可以追溯模型失败的语义根源,而token_dict字段则保留了词法层面的原始分布信息,为后续分析提供了丰富的可解释性基础。
使用方法
使用该数据集时,用户可直接从HuggingFace加载'default'配置下的训练集,数据以Parquet格式存储于data/train-*路径。研究者可基于is_correct字段筛选正确与错误的代码样本,进而利用cyclomatic_complexity、halstead_effort等指标评估不同正确性下代码质量的统计差异。对于关注模型生成多样性的分析,TTR和shannon_entropy可作为核心量化工具。此外,通过组合loc与comment_percentage,可衡量模型在简洁性与可读性之间的权衡。数据集同样适用于训练轻量级代码质量预测器,或作为评估大型语言模型生成稳健性的基准测试套件,尤其适合需要探究模型策略对代码输出结构化影响的场景。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,依托Qwen3-4B模型,聚焦于代码生成任务的细粒度质量评估。其核心研究问题在于如何通过多维度的代码度量指标(如Halstead复杂度、圈复杂度、可维护性指数及香农熵等)客观衡量模型生成代码的正确性、可执行性与结构质量。该数据集收录了164个训练样本,每个样本包含从单元测试通过情况到代码语义复杂度的详尽特征,为代码智能领域提供了从执行结果到代码本身双重视角的评测基准。这一工作推动了代码生成模型评估从传统二元正确性判断向更全面的代码质量评估范式演进,对自动化软件工程与代码优化的研究具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于代码生成任务中缺乏超越简单测试通过率的综合性评估指标,现有模型评价往往忽略代码的可维护性及认知复杂度等深层质量维度。在数据构建层面,挑战源于如何精确量化和标注代码的内在属性,例如Halstead难度与圈复杂度的计算需依赖完整的语法解析,而样本中部分测试运行时间缺失(值为null)反映了动态执行环境的不稳定性。此外,仅164条数据的规模限制了模型泛化能力的分析,且需确保每个样本的entry_point字段唯一以避免任务重复,这在高吞吐量自动化标注场景下增加了数据清洗的复杂度。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的性能与代码质量评估,经典使用场景在于衡量大语言模型在编程任务中的执行正确性与代码可维护性。通过记录任务ID、执行结果、测试通过数与失败数等元数据,研究者可系统性地分析模型生成代码的功能正确性。结合圈复杂度、维护指数、Halstead复杂度等软件工程指标,数据集被广泛用于评估模型输出代码的结构质量与可读性,为代码生成领域提供了从功能到质量的全面评价基准。
衍生相关工作
该数据集衍生出一系列关于代码质量预测与生成模型鲁棒性分析的研究工作。研究者基于其中的软件工程特征构建了生成代码质量预测模型,旨在预判输出代码的可维护性与潜在缺陷。部分工作将其与代码克隆检测、复杂度归约等经典问题结合,探索复杂度指标对检索增强生成策略的指导作用。此外,该数据集还催生了针对多轮对话场景下代码修复效果的度量基准,成为连接软件工程度量与大型语言模型评估的关键桥梁。
数据集最近研究
最新研究方向
面向代码智能的综合性评估与可复现性研究是当前自动化编程领域的前沿方向。该数据集聚焦于结构化编程任务(如autophagycode)的质量评估与度量,通过HuggingFace平台公开了包含任务标识、代码复杂度(如圈复杂度、Halstead指标)、执行正确性、测试覆盖率及语言熵等多维特征的数据。其核心价值在于为大型语言模型(如Qwen3-4B)在代码生成任务中的可信度与鲁棒性评估提供标准化基准。近期研究热点包括利用该数据集分析模型输出代码的可维护性、可执行性及错误模式,并构建预测模型以优化策略(如trust_t1.1策略)。这一方向不仅推动代码生成质量的量化分析,也为智能编程工具的可靠部署奠定了数据基础,继而缓解大模型在软件工程中的“黑箱”问题,具有显著的学术与实践冲击力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务