遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码分析相关的数据,用于评估编程任务的执行和代码质量。它提供了164个训练样本,每个样本包含任务ID、入口点函数、可执行性标志、正确性标志、测试通过和失败数量、错误类型,以及多种代码复杂度指标(如Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数),还包括代码行数(LOC和SLOC)、注释比例、词汇多样性(TTR)、香农熵和预测熵等特征。数据集可能用于机器学习模型训练,以分析代码性能、错误检测或代码质量评估。

This dataset contains code analysis-related data for evaluating the execution and code quality of programming tasks. It provides 164 training samples, each including task ID, entry point function, executability flag, correctness flag, number of tests passed and failed, error type, and various code complexity metrics (such as Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index), as well as lines of code (LOC and SLOC), comment percentage, lexical diversity (TTR), Shannon entropy, and predictive entropy. The dataset is likely used for machine learning model training to analyze code performance, error detection, or code quality assessment.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run2_metrics,旨在评估代码生成模型在特定策略下的输出质量。数据集构建基于Qwen3-4B模型,采用名为“trust”的生成策略,设置温度参数t为1.25与生成数量g为1,对一批代码任务进行推理。每个样本包含任务标识、入口函数、可执行性、正确性标签、测试通过/失败数、运行耗时以及错误类型等基础评估指标。尤为关键的是,数据集纳入了Halstead复杂度度量(包括词汇量、长度、体积、难度、耗时)与McCabe圈复杂度、可维护性指数、代码行数、注释占比、词符类型-词符比(TTR)、香农熵及预测熵等软件度量学特征,从而构建一个多维度、细粒度的代码质量评估集合。
特点
本数据集的核心特点在于其融合了代码功能性验证与软件度量学分析的双重视角。除了传统的执行正确性(如测试通过/失败数)与可执行性判断外,它系统性地引入了Halstead系列指标、圈复杂度与可维护性指数,从代码的算法复杂度和可读性层面刻画生成结果。同时,通过香农熵与预测熵度量代码的随机性与不确定性,TTR反映词符多样性,token_dict则保留了原始词符分布信息。这些丰富的特征使得数据集不仅能用于评判模型输出是否“正确”,更能深入分析其“质量”,支持对代码生成策略在泛化能力、结构优雅度与执行效率等方面的综合评估。
使用方法
该数据集适用于多类代码智能研究场景。用户可直接加载训练集(包含164个样本),利用task_id与entry_point进行任务定位,以is_correct和tests_passed等字段作为分类或回归任务标签。借助Halstead与圈复杂度等连续型特征,可构建代码质量预测模型。同时,通过组合entropy族特征与复杂度指标,可分析生成策略的稳定性与多样性。数据集以标准HuggingFace格式存储,支持通过datasets库快速加载,并可直接与Python的pandas、scikit-learn等工具衔接,便于开展模型评估、特征分析及对比实验。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run2_metrics,由autophagycode团队于近期创建,旨在系统评估大型语言模型(LLM)在代码生成任务中的执行正确性与代码质量。核心研究问题聚焦于如何通过量化指标(如Halstead复杂度、圈复杂度、可维护性指数、香农熵等)和测试执行结果(测试通过数、失败数、错误类型)来度量模型生成代码的可靠性与健壮性。该数据集包含164条训练样本,每条样本涵盖从语法结构、执行行为到信息论特征的多元维度,为LLM代码生成的细粒度评估提供了基础性资源。其在自动化代码评估、智能编程辅助系统及软件可靠性验证等领域具有潜在影响力,旨在推动从单纯功能正确性向代码内在质量评测的范式转型。
当前挑战
该数据集解决的领域问题是LLM代码生成的可信度与实用性评估,即现有评估多依赖简单测试通过率,难以全面反映代码的可维护性、复杂度及隐藏缺陷。构建过程中面临多重挑战:一是特征多样性带来的标注一致性难题,需精确计算22个结构、执行及信息论指标;二是测试环境的不确定性,如运行时间波动、平台差异对is_executable等布尔字段的影响;三是错误类型的语义分类模糊性,如难以区分逻辑错误与边界情况;四是小规模样本(164条)的统计代表性不足,可能影响模型泛化能力评估;五是entry_point_repeated字段揭示的重复代码检测问题,需结合token_dict与TTR等指标平衡计算效率与准确性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型在算法编程任务中的执行性能与代码质量评估,是研究大语言模型代码生成能力与代码可信性的重要基准。通过记录每段生成代码的测试通过率、错误类型及运行时性能,研究者可系统性地分析模型在复杂编程问题上的鲁棒性,亦可结合Halstead复杂度与圈复杂度等软件工程指标,深入探讨生成代码的可维护性与认知负荷,从而构建从模型输出到代码品质的完整评价链条。
实际应用
在自动化编程辅助、智能教学评测及低代码开发平台中,该数据集可用于训练和筛选更适配实际开发需求的代码生成模型。通过分析生成代码的测试通过率与复杂度指标,开发者可优先采纳高可维护性的模型输出,减少后续调试成本;同时,该数据集支持构建面向编程教育的自动批改系统,借助代码质量特征诊断学生代码中的潜在缺陷,提升编程实践的教学效率。
衍生相关工作
该数据结构催生了多项经典衍生研究,包括基于Halstead指标的可解释代码质量预测模型、结合圈复杂度的代码生成能力基线评估方法,以及利用香农熵检测模型幻觉的实证分析。这些工作将数据集中的静态代码特征与动态执行表现关联,构建了代码正确性、复杂性与可读性之间的多维映射关系,为后续研究者开发同时考虑功能与品质的代码生成系统提供了标准化评估框架与可复现的实验基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务