遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g10_run0_metrics

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,用于代码质量评估或编程任务分析。每个样本具有多个特征,包括任务标识符、入口点、可执行性、正确性、测试通过/失败数量、错误类型,以及软件工程度量指标如Halstead复杂度(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、标记字典、香农熵、预测熵(均值和最大值)、定义函数数量,以及入口点重复性。数据集可能用于研究代码性能、错误检测或机器学习模型训练。

This dataset contains 164 training examples for code quality assessment or programming task analysis. Each example includes multiple features such as task identifier, entry point, executability, correctness, number of tests passed/failed, error type, and software engineering metrics like Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, predictive entropy (mean and max), number of functions defined, and entry point repetition. The dataset is likely used for researching code performance, error detection, or training machine learning models.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g10_run0_metrics 数据集图片
构建方式
该数据集的构建立足于代码生成质量评估这一研究脉络,通过对程序合成任务中模型输出结果的系统性度量来形成结构化记录。其构建过程以Qwen3-8B模型在特定解码策略下的生成为数据来源,围绕每个任务实例采集可执行性判定、正确性验证与测试用例通过情况等执行层面指标,同时借助静态分析手段提取Halstead度量族、圈复杂度、可维护性指数、代码行统计与注释占比等代码特征,并进一步计算词汇丰富度、香农熵及预测熵等语言统计量,最终将多维度评估结果整合为统一的表格化数据,划分为训练集供后续研究使用。
特点
该数据集的核心特征在于将代码执行结果与静态结构度量、语言统计特征深度融合于同一数据框架之中。每条记录既包含任务标识、入口点、可执行与正确性判定、测试通过及失败数量等运行信息,也涵盖Halstead词汇量、长度、体积、难度、工作量与时间等经典软件度量,以及圈复杂度、可维护性指数、代码行数、注释百分比等结构指标。此外,词汇类型比、分词字典、香农熵与平均及最大预测熵等特征从信息论视角刻画了代码文本的分布特性,而函数定义数量与入口点重复标记则补充了程序组织层面的信息,使数据集具备多维交叉分析的能力。
使用方法
该数据集的使用方式围绕代码生成评估与质量分析展开。研究者可将训练集载入后,以is_executable与is_correct等字段作为监督信号,分析模型生成代码在功能正确性上的表现,并结合tests_passed与tests_failed评估测试覆盖程度。借助Halstead度量、圈复杂度、可维护性指数与代码行等字段,可开展代码复杂度与可维护性的相关性研究;利用香农熵、预测熵与词汇类型比等统计量,则可探讨生成文本的不确定性与代码质量之间的关联。数据亦适用于错误类型分布分析、入口点重复现象研究以及基于多维特征的预测建模等任务。
背景与挑战
背景概述
随着大语言模型在代码生成领域的广泛应用,对模型输出代码的质量评估已从单一的正确性判断演变为多维度量化的系统工程。该数据集由autophagycode团队于近年构建,依托Qwen3-8B模型在trust策略下以温度0.75、组规模10生成的代码样本,经系统化度量后形成164条训练实例。其核心研究问题在于建立涵盖可执行性、正确性、测试通过率、Halstead复杂度、环路复杂度、可维护性指数及预测熵等指标的代码质量画像,从而揭示模型生成代码在功能与结构层面的综合表现。该数据集为代码生成模型的细粒度评估提供了可复用的度量范式,推动了从通过率导向向质量导向的评测转型,对代码智能领域的基准建设具有参考意义。
当前挑战
该数据集所面对的领域问题在于代码生成评估长期依赖单元测试通过率,难以捕捉可维护性、复杂度及模型不确定性等深层质量维度,亟需构建多指标融合的评估基准。在构建过程中,挑战体现在多个方面:测试运行时间字段存在缺失,导致时序性能分析受限;错误类型分类需在异构执行环境中保持一致性;Halstead与环路复杂度等静态指标对代码片段的解析敏感,易受语法噪声干扰;预测熵的引入要求模型输出具备可复现的概率分布,而温度采样与组规模设置可能引入随机性偏差。上述因素共同增加了数据标注与度量结果的可比性难度。
常用场景
经典使用场景
在程序合成与自动化代码生成的研究领域中,该数据集通常被视为评估大语言模型代码生成质量与执行正确性的基准资源。其经典使用场景聚焦于对模型生成的代码进行多维度静态与动态分析,包括通过测试用例验证功能正确性,以及利用Halstead度量、圈复杂度、可维护性指数等软件工程指标量化代码质量。研究者借此可系统性地比较不同解码策略或提示方法对生成代码的效用差异。
衍生相关工作
围绕该数据集,后续研究衍生出若干经典工作方向,包括基于预测熵的代码不确定性估计、结合静态分析与动态执行的混合评估框架,以及针对特定错误类型开展的错误传播与修复策略研究。这些工作进一步拓展了数据集在模型校准、鲁棒性测试与可解释性分析等领域的应用边界,形成了以代码质量多维量化为核心的研究生态。
数据集最近研究
最新研究方向
针对代码生成模型输出质量的精细化评估已成为软件工程与人工智能交叉领域的前沿议题。该数据集依托Qwen3-8B模型在信任策略与温度采样下的生成轨迹,系统整合了Halstead度量、圈复杂度、可维护性指数及预测熵等多元指标,为探究模型生成代码的可执行性、正确性与结构复杂性之间的深层关联提供了细粒度实证基础。当前研究热点聚焦于利用此类多维度度量数据揭示大模型代码生成中的置信度校准与错误模式,进而推动可信代码生成与自动化程序修复的发展,对提升AI辅助编程的可靠性具有重要影响与意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务