遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码函数及其相关的静态分析指标,包括Halstead复杂度、圈复杂度、维护指数、代码行数、注释百分比等,以及函数的执行结果(是否正确、通过的测试数等)。它用于评估代码质量或进行代码度量分析。

This dataset contains code functions along with their static analysis metrics, including Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, etc., as well as execution results (whether correct, tests passed, etc.). It is used for code quality evaluation or code metric analysis.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
该数据集基于Qwen3-8B模型在自动代码修复任务中的评估结果构建而成。具体而言,通过对初始代码生成进行多轮筛选与执行验证,系统收集了每个修复实例的任务标识(task_id)、核心函数入口(entry_point)以及是否可执行(is_executable)等底层属性。在此基础上,进一步采集了代码执行后的正确性判定(is_correct)、通过与失败的测试用例数量(tests_passed/tests_failed)、运行耗时(test_run_time_ms)以及错误类型(error_type)等动态指标。此外,数据集还整合了Halstead复杂度系列指标、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc/sloc)、注释比例(comment_percentage)、词汇重复率(TTR)、香农熵(shannon_entropy)以及预测熵(mean/max_predictive_entropy)等静态代码质量特征,从而形成对代码修复结果的多维度量化描述。
特点
本数据集的核心特色在于其融合了动态执行反馈与静态代码度量两种视角,为代码智能研究提供了丰富的量化分析基础。其中,执行层面的指标(如测试通过失败数、错误类型)直接反映了代码的功能正确性,而Halstead复杂度系列指标与圈复杂度则刻画了代码的结构复杂度和维护成本。值得注意的是,数据集中包含的预测熵(mean/max_predictive_entropy)与香农熵特征,为探究模型生成代码的不确定性与信息量提供了独特视角。此外,词元字典(token_dict)、词汇重复率(TTR)以及函数定义数量(n_func_defined)等特征,使得研究者能够从代码词汇模式与函数组织维度深入剖析生成代码的规律。作为一个包含164个训练样本的小规模专用评估集,该数据集专注于Qwen3-8B模型在特定策略(strategy_trust_t1.25_g5)下的代码修复行为分析。
使用方法
该数据集以标准HuggingFace Datasets格式存储,用户可通过datasets.load_dataset()方法直接加载train分片进行使用。数据集中所有特征均为结构化字段,便于直接应用于代码质量预测、错误类型分类、复杂度回归分析等监督学习任务。同时,研究者可利用代码正确性标签(is_correct)与测试通过比例作为目标变量,结合Halstead复杂度、圈复杂度、可维护性指数及熵特征作为输入特征,构建代码可修复性评估模型。此外,针对代码注释质量分析场景,可通过comment_percentage与TTR特征进行探索性分析,而token_dict和shannon_entropy则适合用于代码词汇分布与信息密度研究。数据集的小规模特性使其特别适用于原型验证、特征工程实验以及模型行为对比等研究场景。
背景与挑战
背景概述
该数据集由研究团队于近期构建,旨在评估代码生成模型在自动化编程任务中的表现。其核心研究问题聚焦于如何通过多维度代码质量指标(如Halstead复杂度、圈复杂度、维护性指数等),量化模型生成代码的可靠性、可维护性与执行效能。数据集包含164个训练样本,每个样本记录了一次代码生成任务的执行结果、静态分析特征及熵值信息。该工作为代码智能领域提供了细粒度的评估基准,有助于推动模型从单纯的功能正确性向代码质量的综合治理演进。
当前挑战
当前数据集面临的核心挑战在于规模有限带来的统计稳定性问题。164个样本难以覆盖多样化的编程场景,可能导致复杂度指标与真实软件工程实践之间存在偏差。构建过程中,测试执行的覆盖率不足与错误类型的稀疏分布使得模型泛化能力评估受限。此外,代码复杂度特征(如Halstead难度、香农熵)间的多重共线性,增加了可解释性分析的难度。未来需扩展数据规模并引入更多元化的代码库与执行环境,以提升基准的鲁棒性与领域适应性。
常用场景
经典使用场景
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run0_metrics,主要记录了大语言模型在代码生成任务中的执行性能与代码质量评估指标。典型的使用场景是对比不同生成策略(如信任度阈值t=1.25、生成束宽g=5)下模型输出代码的准确率、测试通过率、运行时间以及各类软件度量学指标。研究者可通过该数据集系统性地分析模型生成代码的可靠性、可维护性与执行效率,从而优化生成式代码智能体的部署方案。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,包括生成参数自适应优化算法、代码质量预测模型以及解码策略对比基准测试。例如,有工作利用圈复杂度与可维护性指数训练分类器,实现生成代码的“预筛选”;另有研究通过分析不同束宽下的哈尔斯特德努力值,提出针对特定编程语言的最佳生成策略。这些工作共同拓展了从度量视角优化代码生成模型的研究路径,并对后续在代码智能体鲁棒性、可解释性方向的探索产生了深远影响。
数据集最近研究
最新研究方向
在代码生成与自动修复领域,该数据集聚焦于大语言模型(如Qwen3-8B)生成代码的运行时行为与软件质量度量,通过集成Halstead复杂度、圈复杂度、可维护性指数及预测熵等指标,揭示模型输出在结构复杂度、执行正确性与信息不确定性之间的深层关联。其前沿研究方向融合了神经符号评估与软件工程静态分析,探讨模型在策略驱动下(如trust策略、温度与生成轮次调控)所产代码的鲁棒性,尤其是针对代码可执行性与测试通过率的细粒度分析,为理解大模型在编程任务中的泛化边界与失败模式提供了高维度的量化视角,对推动可靠代码合成与自动化调试的范式演进具有显著价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务