遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,专注于代码任务执行和质量度量分析。每个示例具有多个特征:task_id(任务标识符)、entry_point(入口点)、is_executable(是否可执行)、is_correct(是否正确)、tests_passed(通过的测试数)、tests_failed(失败的测试数)、test_run_time_ms(测试运行时间,但当前为null)、error_type(错误类型),以及代码复杂度指标如halstead_vocabulary(Halstead词汇量)、halstead_length(Halstead长度)、halstead_volume(Halstead体积)、halstead_difficulty(Halstead难度)、halstead_effort(Halstead工作量)、halstead_time(Halstead时间)、cyclomatic_complexity(圈复杂度)、maintainability_index(可维护性指数)、loc(代码行数)、sloc(源代码行数)、comment_percentage(注释百分比)、TTR(类型标记比)、token_dict(令牌字典)、shannon_entropy(香农熵)、mean_predictive_entropy(平均预测熵)、max_predictive_entropy(最大预测熵)、n_func_defined(定义函数数)、entry_point_repeated(入口点是否重复)。数据集用于分析代码执行结果、测试性能和软件质量,适用于软件工程、代码评估或机器学习研究。

本数据集包含164条训练样本,聚焦于代码任务执行与质量度量分析。每条样本均涵盖多项特征:task_id(任务标识符)、entry_point(入口点)、is_executable(可执行性标识)、is_correct(正确性标识)、tests_passed(通过测试数)、tests_failed(失败测试数)、test_run_time_ms(测试运行时长,当前暂为空值)、error_type(错误类型),以及各类代码复杂度指标:halstead_vocabulary(哈尔斯特德词汇量,Halstead Vocabulary)、halstead_length(哈尔斯特德长度,Halstead Length)、halstead_volume(哈尔斯特德体积,Halstead Volume)、halstead_difficulty(哈尔斯特德难度,Halstead Difficulty)、halstead_effort(哈尔斯特德工作量,Halstead Effort)、halstead_time(哈尔斯特德耗时,Halstead Time)、cyclomatic_complexity(圈复杂度,Cyclomatic Complexity)、maintainability_index(可维护性指数,Maintainability Index)、loc(代码行数,Lines of Code, LOC)、sloc(源代码行数,Source Lines of Code, SLOC)、comment_percentage(注释占比)、TTR(类型标记比,Type-Token Ratio)、token_dict(令牌字典,Token Dictionary)、shannon_entropy(香农熵,Shannon Entropy)、mean_predictive_entropy(平均预测熵,Mean Predictive Entropy)、max_predictive_entropy(最大预测熵,Max Predictive Entropy)、n_func_defined(已定义函数数量)、entry_point_repeated(入口点重复标识)。本数据集可用于分析代码执行结果、测试性能与软件质量,适用于软件工程、代码评估或机器学习相关研究。

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run2_metrics,是面向代码智能领域中程序语义理解与执行验证任务而构建的评估性数据集。在构建过程中,数据集的核心单元以编程问题(task_id)为入口,每个问题对应一个特定的函数入口点(entry_point),并记录了模型生成的代码是否可执行(is_executable)以及执行结果是否正确(is_correct)。通过测试通过数(tests_passed)与失败数(tests_failed)的详细量化,并结合测试运行时间(test_run_time_ms)及错误类型(error_type),实现了对代码功能正确性与运行效率的全面捕捉。此外,数据集还纳入了海尔斯德度量(如词汇量、长度、难度等)、圈复杂度、维护性指数、代码行数(loc/sloc)、注释比例及TTR等静态代码特征,同时融合了香农熵与预测熵等语言模型不确定性度量,构成了多维度、精细化的指标体系。整个数据集仅包含一个训练分片,共164条样本,总大小约234KB。
特点
该数据集的特点在于其高度结构化且多维度的代码质量评估框架,旨在从执行结果与代码属性两个层面全面刻画模型生成代码的优劣。一方面,它直接提供了测试通过/失败的二元与数值指标,以及错误类型的分类标签,使得研究者可以快速定位代码的功能性缺陷;另一方面,海尔斯德度量、圈复杂度和维护性指数等软件工程领域的经典指标,能有效揭示代码的复杂程度与可维护性。尤为独特的是,数据集中引入了token字典(token_dict)与三种熵值(香农熵、均值预测熵、最大预测熵),这为从信息论角度分析代码片段的复杂度与模型预测的不确定性提供了可能。同时,entry_point_repeated字段标记了函数入口点是否重复,n_func_defined则统计了代码中定义的函数数量,这些细节增强了数据集对代码结构一致性的监控能力。整体而言,该数据集兼顾了执行验证的客观性与代码度量的理论深度,适合用于评估或训练具备代码生成与理解能力的模型。
使用方法
使用该数据集时,可直接通过HuggingFace Datasets库加载其默认配置,数据文件以parquet或arrow格式存储于data/train-*路径下。加载后,每条样本包含上述所有字段,适用于多种下游任务:例如,研究人员可利用is_correct和tests_passed等字段作为监督信号,训练代码正确性预测模型;或使用cyclomatic_complexity、maintainability_index等度量作为特征,开展代码质量回归分析。海尔斯德度量与熵值类字段可作为输入特征,用于探究代码复杂度与模型输出不确定性的关联。鉴于数据量较小(164条),适合作为验证集或与外部大规模数据集联合使用,也可通过微调小规模模型来分析特定策略(如trust策略)对代码生成的影响。使用者应注意将task_id与entry_point作为关键标识符,关联原始编程问题与待评估函数,从而确保实验的可复现性。
背景与挑战
背景概述
该数据集由研究团队基于代码大模型评估需求构建,创建于2025年,聚焦于代码生成任务中模型输出质量的细粒度分析。核心研究问题在于如何通过多维度的代码质量指标(如Halstead复杂度、圈复杂度、可维护性指数等)量化大模型生成代码的执行正确性、效率与可读性,从而推动代码智能领域的评估标准从单一正确性向综合质量演进。数据集包含164个训练样本,每个样本涵盖从执行状态到熵值的20余项特征,为代码生成模型的鲁棒性研究提供了结构化支撑,对提升大模型在软件工程中的可信应用具有奠基意义。
当前挑战
当前领域面临的挑战在于:1)代码生成任务的评估长期依赖测试用例通过率这一浅层指标,难以刻画代码在可维护性、计算效率等工程维度的真实表现;2)现有数据集多面向自然语言处理任务,缺乏针对代码结构化特征的系统性标注,使得模型优化方向模糊;3)构建过程中,需要对模型生成的每段代码执行动态测试并提取多种静态度量,计算成本高昂且需保证错误类型划分的语义准确性,同时样本量有限(164例)可能制约泛化性分析的统计效力。
常用场景
经典使用场景
在代码智能与软件工程研究领域,评估和提升代码生成模型的可信度与稳定性是核心挑战之一。该数据集专为代码生成任务的安全性评估与可信修复策略分析而设计,其经典使用场景聚焦于衡量模型在复杂编程问题上的代码生成质量,通过记录每条样本的测试通过/失败状态、运行时错误类型及多种软件度量指标(如圈复杂度、海斯特德复杂度、可维护性指数等),研究者能够系统性地分析模型输出代码的语义正确性、结构可维护性及潜在风险,从而为构建更可靠的代码生成系统提供基准。
衍生相关工作
基于该数据集的丰富度量体系,已涌现出一系列代表性衍生研究工作。一方面,研究者利用海斯特德复杂度与圈复杂度作为输入特征,训练错误类型分类器,实现了对生成代码中潜在运行时缺陷的预测性检测。另一方面,数据集中Shannon熵与预测熵的引入催生了针对代码生成模型不确定性估计的研究,推动了基于熵阈值过滤的可靠代码选择策略。此外,可维护性指数与代码行数的联合分析被用于开发代码异味检测方法,而执行时间与测试通过状态的关系建模则衍生出性能回退风险预警框架。这些工作共同拓宽了代码生成质量保障的技术边界。
数据集最近研究
最新研究方向
在代码智能与软件工程交叉领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run2_metrics数据集聚焦于大型语言模型生成代码的可靠性评估与质量量化。该数据集通过捕获Qwen3-4B模型在特定信任策略下的运行时指标,如测试通过率、Halstead复杂度、圈复杂度和维护性指数,为前沿研究提供了从静态代码度量到动态执行反馈的多维分析维度。其研究方向紧密围绕当前热点——如何让AI生成代码在真实场景中达到工业级可信标准,通过整合执行正确性、程序熵与认知负荷等微观指标,该数据集推动了对模型代码生成行为的细粒度理解,对构建更安全、更可解释的代码生成系统具有里程碑意义,尤其是在自动驾驶、医疗信息系统等高风险领域,这种量化评估框架至关重要。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务