遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g5_run1_metrics

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务的代码质量度量和测试结果。特征包括任务ID、入口点、测试结果(通过/失败)、Halstead度量、圈复杂度、可维护性指数以及其他代码度量。数据集旨在用于分析代码质量和性能。

This dataset contains code quality metrics and test results for programming tasks. It includes features such as task ID, entry point, test results (passed/failed), Halstead metrics, cyclomatic complexity, maintainability index, and other code metrics. The dataset is intended for analyzing code quality and performance.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g5_run1_metrics 数据集图片
构建方式
该数据集立足于代码生成模型性能评估的实证研究背景,通过运行Qwen3-8B模型对编程任务进行求解,并以策略trust、温度参数0.75、组大小5、第一轮运行的方式采样生成候选代码。构建过程中,系统对每个任务执行自动化单元测试,记录通过与失败的测试数量、运行时长及错误类型,进而借助静态分析工具提取Halstead复杂度、圈复杂度、可维护性指数、代码行数等程序度量,同时计算词型形符比、香农熵以及预测熵等文本统计量,最终将任务标识、入口点、执行状态与上述多维指标整合为结构化的训练集样本。
特点
该数据集的核心特质在于将代码生成结果与多维度的质量度量深度融合,涵盖从可执行性、正确性到代码复杂度与信息论指标的完整谱系。特征字段包括任务标识、入口点、是否可执行、是否通过测试、测试通过数与失败数、错误类型,以及Halstead系列度量、圈复杂度、可维护性指数、代码行与逻辑行、注释比例、词型形符比、香农熵、预测熵的均值与最大值、定义函数数量、入口点重复标记等。这些属性既反映程序的功能正确性,也刻画代码结构、可读性与模型预测的不确定性,为细粒度分析代码生成模型的行为提供了丰富依据。
使用方法
使用该数据集时,研究者可借助HuggingFace datasets库加载默认配置下的训练划分,获取包含164个样本、约230KB的结构化数据。每个样本以JSON格式提供任务标识、入口点、执行正确性及一系列静态与信息论度量,适合用于分析代码生成模型在不同复杂度与熵值条件下的表现差异。典型应用包括构建预测模型以估计代码可执行性或正确性,探究代码度量与测试结果之间的关联,或评估模型预测熵与代码质量的关系。使用时需注意所有度量均基于特定模型与采样策略生成,迁移至其他场景时应结合具体实验背景进行校准。
背景与挑战
背景概述
在代码生成与程序合成研究领域,如何评估大语言模型生成代码的质量与正确性已成为核心议题。该数据集由相关研究团队构建,旨在通过多维度指标刻画模型生成代码的执行结果与静态属性,涵盖任务标识、可执行性、测试通过率、Halstead度量、圈复杂度及信息熵等特征。其核心研究问题在于探索代码生成过程中的质量评估与错误模式分析,为自动化编程评测提供细粒度数据支撑,对推动代码智能与软件工程领域的发展具有积极意义。
当前挑战
该数据集所应对的领域问题在于代码生成质量的自动化评估与错误归因,传统方法往往依赖单一通过率指标,难以全面反映生成代码的可维护性与复杂性。构建过程中面临多重挑战:需从模型输出中提取并标准化执行结果与静态度量,确保测试用例执行环境的一致性与可复现性;同时,预测熵等信息论指标的引入要求对模型输出分布进行准确估计,而执行时间等字段的缺失亦对数据完整性构成制约。
常用场景
经典使用场景
在程序合成与自动化代码生成领域,该数据集经典地用于评估大语言模型生成Python函数级代码的正确性与质量。通过整合任务标识、入口点、可执行性、正确性及测试通过/失败计数等标注,研究者能够系统性地衡量模型在真实编程任务上的表现,并借助Halstead度量、圈复杂度、可维护性指数等静态指标深入剖析生成代码的结构特征。
解决学术问题
针对代码生成研究中长期存在的评估维度单一、缺乏细粒度质量分析等问题,该数据集提供了多维度指标与执行反馈的融合标注,有效支撑了模型正确性、可维护性、复杂度及预测熵等交叉分析,推动了代码智能领域从粗粒度匹配向细粒度质量评估的范式转变,为后续研究奠定了可复现的基准。
衍生相关工作
围绕该数据集,后续研究衍生出多条经典工作脉络,包括基于预测熵不确定性估计的代码生成可靠性分析、融合Halstead与圈复杂度的代码质量预测模型、以及面向执行反馈的强化学习微调方法。这些工作进一步拓展了代码大模型在正确性、鲁棒性与可解释性方面的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务