遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和软件质量评估的数据集,包含164个训练样本。每个样本代表一个代码任务,具有多个特征:任务ID、入口点、可执行性标志、正确性标志、测试通过和失败数量、错误类型、Halstead度量(词汇量、长度、体积、难度、努力、时间)、循环复杂度、可维护性指数、代码行数(总行数和源代码行数)、注释百分比、TTR(类型标记比)、token字典、香农熵、平均和最大预测熵、函数定义数量以及入口点是否重复。这些特征用于评估代码的复杂性、可读性和可维护性,适用于机器学习模型训练或代码质量研究。

This dataset is designed for code analysis and software quality assessment, containing 164 training examples. Each example represents a code task with multiple features: task ID, entry point, executability flag, correctness flag, number of tests passed and failed, error type, Halstead metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (total and source), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, mean and maximum predictive entropy, number of functions defined, and whether the entry point is repeated. These features are used to evaluate code complexity, readability, and maintainability, suitable for training machine learning models or research on code quality.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g5_run0_metrics 数据集图片
构建方式
该数据集基于大型语言模型Qwen3-4B在代码生成任务上的推理结果构建而成,聚焦于评估模型在编程问题上的执行正确性与代码质量。数据集的构建流程始于模型对特定编程任务的回答,随后通过自动化测试框架对生成的代码进行执行验证,记录其是否可运行、测试通过数量、失败数量及运行时间等关键指标。同时,引入了Halstead复杂度度量与圈复杂度等软件工程指标,从词汇量、长度、体积、难度、工作量及时间等多个维度量化代码的静态结构特性。此外,还计算了可维护性指数、代码行数、注释比例、词型词符比、香农熵以及模型预测熵等特征,以全面刻画代码的复杂度、可读性与模型的不确定性。最终,数据集中包含164个训练样本,每个样本均标注了任务标识、入口函数及重复性标记,为后续分析与微调提供了结构化的基础。
特点
本数据集的核心特点在于其多维度的评价体系,融合了代码执行结果与静态分析指标,从而为理解模型生成代码的质量提供了丰富的视角。除了基础的执行正确性标签,如是否可运行及测试通过数量,数据集还纳入了Halstead系列指标,这些指标源自软件工程中的代码度量理论,能够量化代码的词汇复杂度与认知负荷。圈复杂度和可维护性指数则分别反映了代码的控制流复杂度和长期维护的难易程度。值得一提的是,数据集中还包含了模型预测熵和香农熵,前者揭示了模型在生成特定代码时的置信度波动,后者衡量了代码符号分布的均匀性。这种跨学科的特征组合,使得研究者能够从功能性、结构性、可维护性以及模型行为等多个层面深入剖析代码生成过程的内在规律。
使用方法
该数据集专为代码生成与软件工程交叉领域的研究而设计,适用于模型性能评估、代码质量分析以及推理行为探索等场景。使用者可通过HuggingFace的datasets库轻松加载,指定默认配置即可获取包含164条训练样本的数据集。每条样本以字典形式呈现,包含任务ID、入口函数、执行指标及代码度量值等字段,研究者可据此进行数据过滤、特征工程或统计分析。例如,可以利用测试通过数量与Halstead难度进行相关性分析,或基于预测熵筛选出模型不确定性较高的样本进行针对性优化。由于数据规模适中,亦适合作为验证集或小样本实验的基础数据,支持快速迭代与假设检验。
背景与挑战
背景概述
该数据集由研究人员基于Qwen3-4B模型在代码生成任务中的输出构建,聚焦于评估生成代码的质量与可信度。通过采集164个训练样本,数据集涵盖任务标识、代码执行状态、测试通过率、Halstead复杂度、圈复杂度及维护性指数等多维指标,旨在量化代码的可维护性、复杂性与执行可靠性。这一工作源于对大规模语言模型生成代码的鲁棒性担忧,其创建标志着从纯功能验证向综合性代码质量评估的转变,为后续研究提供了结构化基准。
当前挑战
数据集面临的核心挑战在于代码生成评估的维度整合:传统方法仅依赖执行正确性(如is_correct字段),但无法反映代码结构质量与计算效率。构建过程中需处理稀疏指标(如test_run_time_ms字段为null),以及从代码文本中提取token_dict与香农熵等统计特征时的解析歧义。此外,静态复杂度指标(如Halstead系列)与动态执行结果间的关联性尚未明确,低样本量(164例)也限制了模型泛化能力的验证,亟需扩展数据规模与评估范式。
常用场景
经典使用场景
在代码生成与自动编程领域,该数据集为评估大型语言模型的代码生成质量提供了多维度的量化指标。经典使用场景聚焦于利用Halstead复杂度、圈复杂度、可维护性指数等软件工程度量标准,系统性地分析模型生成的代码在可读性、运行效率与结构健壮性上的表现。研究者常依据该数据集构建细粒度的代码质量评估框架,通过对比执行正确率与测试通过数等运行时指标,深入洞察不同策略调优后的模型在生成功能性代码与高质量代码之间的权衡关系。
实际应用
在实际应用中,该数据集能够支撑自动化代码审查系统的开发与优化。软件工程团队可借助其记录的代码度量信息,训练用于预测代码缺陷或可维护性风险的分类模型。基于该数据集,企业可以构建评估流水线,对模型生成的候选代码片段进行自动化的质量筛选,优先采纳低复杂度、高可读性且通过测试的代码。此外,结合错误类型与运行时间数据,该数据集还可服务于性能敏感场景下的代码择优,加速从模型生成到生产部署的转化进程。
衍生相关工作
该数据集的出现衍生了一系列关于代码质量预测与代码生成策略优化的经典工作。研究者利用其中丰富的信息训练回归模型,实现对新生成代码的复杂度与维护成本的早期预估。部分工作进一步探索了代码度量与模型校准程度之间的关联,提出了基于熵度量融合的生成策略。还有团队基于该数据集开展迁移学习研究,将在本数据上训练的代码质量评估器应用于其他编程语言或更复杂的生成任务中,推动了代码智能评估领域的方法交叉与范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务