遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码质量评估和软件度量分析的数据集,包含164个训练示例。每个示例代表一个代码任务,具有以下特征:任务ID、入口点、是否可执行、是否正确、测试通过和失败数量、测试运行时间(当前为空)、错误类型、Halstead度量(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(可能为类型标记比)、标记字典、Shannon熵、平均和最大预测熵、定义函数数量以及入口点是否重复。数据集旨在支持代码分析、机器学习模型训练或自动化测试研究,通过量化指标评估代码的复杂性、可维护性和测试结果。

This dataset is designed for code quality assessment and software metric analysis, containing 164 training examples. Each example represents a code task with features including task ID, entry point, executability, correctness, number of tests passed and failed, test run time (currently null), error type, Halstead metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (likely Type-Token Ratio), token dictionary, Shannon entropy, mean and max predictive entropy, number of functions defined, and whether the entry point is repeated. The dataset supports code analysis, machine learning model training, or automated testing research by quantifying metrics for code complexity, maintainability, and test outcomes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run1_metrics 数据集图片
构建方式
该数据集源自对Qwen3-4B模型在复杂编程任务上的生成结果进行系统性评估与度量。通过引入信任机制(trust)及温度参数t=1.25、生成次数g=1等策略,采集模型在多个代码生成任务中的执行反馈与静态分析指标。每条样本包含任务标识符、入口函数名、可执行性、正确性、测试通过/失败数量及运行时性能数据,并融合了Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比、词汇丰富度(TTR)等软件工程领域经典度量指标,构建出一个多维度、细粒度的代码质量评估语料库。
特点
数据集的核心特色在于其深度融合了动态执行结果与静态代码质量度量。不仅记录了测试通过/失败、错误类型等运行时行为,还从词汇、结构、复杂度、熵值等多个层面对生成代码进行量化刻画。涵盖均预测熵、最大预测熵等执行不确定性指标,以及函数重复定义检测等逻辑特征,能够全面反映模型在不同难度任务下的代码生成能力与稳定性。训练集包含164条样本,字段丰富,适用于探索代码生成模型的行为模式与质量瓶颈。
使用方法
该数据集适用于训练代码质量预测模型、分析大语言模型在编程任务上的表现特征。用户可基于task_id与entry_point定位具体任务,利用is_executable和is_correct作为分类标签,结合Halstead复杂度、圈复杂度等特征进行回归或分类建模。测试通过/失败数量与运行时间可用于评估生成代码的可靠性与效率。建议在数据加载时采用HuggingFace的datasets库,按默认配置读取train划分,并根据具体研究目标筛选字段或构造衍生特征进行分析。
背景与挑战
背景概述
该数据集由 autophagycode 团队构建,旨在评估基于 Qwen3-4B 语言模型的代码生成策略在信任与可靠性维度的表现。数据集创建于近年大语言模型在代码合成领域取得突破性进展的背景下,核心研究问题聚焦于模型生成代码的可执行性、正确性及代码质量的多维量化评估。通过包含 164 个训练样本,每条样本不仅记录了代码的功能正确性(如 is_correct)和测试通过率(tests_passed),还引入了 Halstead 复杂度、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)等软件工程度量指标,以及香农熵(shannon_entropy)和预测熵等模型不确定性指标,从而构建起从代码质量到模型置信度的立体评估体系。该数据集的发布为代码智能领域提供了跨学科视角的基准资源,促进了软件度量学与大语言模型评估的交叉融合。
当前挑战
当前挑战主要体现在三个方面:其一,所解决的领域问题——代码生成模型的可信评估与质量量化。现有指标如 pass@k 仅能反映功能正确性,无法捕捉代码的可维护性、复杂度或安全性,该数据集虽引入多元度量,但如何将这些异构指标综合为统一的可靠性评分仍缺乏公认标准。其二,构建过程中面临的挑战:测试覆盖的完备性与效率之间的矛盾。数据集仅包含 164 个样本,规模偏小,难以支撑泛化性研究;同时,代码生成任务本身存在无限的可能性空间,测试样例的设计难以覆盖边界情况(如并发、资源泄漏)。其三,模型不确定性指标(如 mean_predictive_entropy)的质量依赖于底层模型的校准程度,当模型过自信或欠自信时,这些熵值可能产生误导,需额外校准方法验证其可靠性。
常用场景
经典使用场景
该数据集专为评估和优化代码生成模型的鲁棒性与可信度而设计,尤其在数学推理与算法编程的交叉领域发挥着重要作用。经典使用场景聚焦于利用任务标识、函数入口点、执行正确性及测试通过失败统计等核心字段,系统性地衡量模型产出代码的功能完备性。通过集成哈斯戴德复杂度、圈复杂度与可维护性指数等多维软件度量指标,研究者得以深入剖析生成代码的语义结构、认知负荷与质量属性,为可执行代码的自动验证与错误模式分类提供了标准化基准。
解决学术问题
该数据集直面代码生成领域长期存在的评估碎片化与度量单一化困境,系统性地引入了包含词汇多样性、香农熵与预测熵在内的语言统计特征,有效填补了模型不确定性量化与代码结构复杂性之间的鸿沟。通过融合程序复杂度与测试运行效率的双重视角,它解决了如何在不依赖人工审查的前提下,客观判断生成代码的鲁棒性与可维护性这一学术难题,推动了可信代码合成与自动程序修复方法论的范式革新。
衍生相关工作
基于该数据集,学界已衍生出多项标志性工作,包括面向代码生成模型的不确定性感知训练策略,通过引入最大预测熵作为正则项来抑制幻觉输出;以及融合可维护性指数的模型架构搜索方法,将圈复杂度作为强化学习奖励信号以引导生成更简洁规范的代码。另有研究者构建了分层错误类型分类器,利用函数定义计数与入口点重复性特征,实现对逻辑错误与语法错误的自动化归因,显著提升了代码修复流程的透明度与效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务