遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务的评估指标,涉及任务ID、执行点、可执行状态、正确性、测试通过与失败数量、错误类型,以及多种代码复杂度度量(如Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数),代码规模指标(如代码行数、有效代码行数、注释比例),词汇多样性(TTR)、熵值(香农熵、预测熵均值和最大值),以及函数定义数量和入口点重复性。数据集适用于代码质量分析、自动化测试验证或程序评估研究。

This dataset includes evaluation metrics for code tasks, covering task ID, entry point, executable status, correctness, number of tests passed and failed, error type, and various code complexity measures (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index), code size metrics (e.g., lines of code, source lines of code, comment percentage), lexical diversity (TTR), entropy values (Shannon entropy, mean and max predictive entropy), number of function definitions, and entry point repetition. The dataset is suitable for code quality analysis, automated test validation, or program evaluation research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run1_metrics 数据集图片
构建方式
本数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run1_metrics,是在代码生成与评估领域下,基于特定模型与策略进行实验验证的产物。该数据集通过调用Qwen3-8B模型,采用名为“trust”的生成策略,并设定温度为1.25、生成长度为4的参数配置,对来自autophagycode_D_he_train数据集的代码任务进行推理。随后,利用Mercury执行引擎对生成的代码进行编译与运行,记录其正确性、可执行性及运行时指标,同时辅以Halstead复杂度、圈复杂度、可维护性指数等软件度量标准进行深度代码质量分析,最终汇集为一份包含164个样本的多维度代码评估数据集。
特点
该数据集的核心特点在于其多维度、细粒度的代码质量评估体系。它不仅收录了基础的执行结果(如tests_passed、tests_failed及错误类型),还引入了代码可维护性指标(maintainability_index)、圈复杂度(cyclomatic_complexity)、以及Halstead系列复杂度度量(如词汇量、长度、工作量等),从可读性、复杂度和可维护性等角度刻画代码内在质量。此外,数据集涵盖词频分布(token_dict)、信息熵(shannon_entropy)及预测熵等统计量,为代码的语义多样性与不确定性分析提供了珍贵素材。这种复合型特征设计,使得数据集兼具执行验证与静态分析的双重价值。
使用方法
该数据集适用于代码生成模型的效果评估与对比研究。用户可加载训练集(train split)中的164条记录,利用is_correct和tests_passed字段评估模型生成代码的功能正确性;通过halstead_effort、cyclomatic_complexity、maintainability_index等指标分析代码的复杂度与可维护性;借助shannon_entropy与predictive_entropy系列特征探究代码生成的语义多样性。推荐配合Python环境中的pandas库读取JSONL格式数据进行批量分析与可视化,亦可作为微调数据集,提升模型在代码可读性与低复杂度生成方面的表现。
背景与挑战
背景概述
该数据集由autophagycode研究团队基于Qwen3-8B模型与信任策略(strategy_trust)构建,创建于2025年,旨在系统评估代码生成模型在复杂编程任务中的性能与代码质量。核心研究问题聚焦于如何通过多维度度量指标(如Halstead复杂度、圈复杂度、熵值等)量化模型生成代码的可维护性、正确性与执行效率。数据集包含164个训练样本,涵盖从基础语法到异构逻辑的编程任务,为代码智能领域提供了细粒度的评估基准。其影响力体现在突破传统仅依赖通过率或正确性的单一评价模式,推动生成代码质量评估向结构化、可复现的方向发展。
当前挑战
该数据集所解决的领域问题是代码生成模型评估的维度缺失,即现有基准(如HumanEval)忽视了代码可维护性、认知复杂度与执行效率的量化,导致模型产出偏离工程实践。构建过程中面临两大挑战:一是跨语言与跨任务场景下Halstead度量与圈复杂度等静态指标的自适应标准化,需平衡通用性与领域特异性;二是信任策略(strategy_trust)的阈值设计(如温度系数t=1.25、生成次数g=4)对样本多样性造成偏差,可能引入结构性偏好,需通过扩大任务规模与嵌入动态验证机制缓解评估泛化不足的问题。
常用场景
经典使用场景
该数据集汇集了通过代码大模型(如Qwen3-8B)对开源基准任务生成的代码执行结果与多维度的静态分析指标,包括哈里斯蒂德复杂度、圈复杂度、可维护性指数以及香农熵等。经典使用场景聚焦于探究代码生成质量与软件复杂度之间的内在关联,研究者可借此分析大模型生成代码的可执行性、正确率与软件度量指标之间的统计规律。
解决学术问题
该数据集为解决代码智能领域中一个核心问题提供了数据支撑:如何系统性地评估大语言模型生成代码的质量,而不仅仅是依赖传统的通过/失败二分类指标。通过引入哈里斯蒂德度量、循环复杂度与可维护性指数等软件工程度量,研究人员能够更精细地刻画生成代码的认知负荷、结构稳健性与长期维护成本。这推动了从单一正确性判据向多维度质量评估范式的学术转型。
衍生相关工作
由此衍生的相关工作包括基于该度量框架的代码质量排序算法、可维护性预警系统以及代码生成模型的多目标优化策略。例如,研究者已将其作为基础特征集,训练分类器以区分高可靠与低可靠的生成代码,并探索了结合TTR与香农熵的代码混淆度评估方法。这些工作共同拓展了代码生成质量工程的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务