stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g4_run1_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含代码样本的多种质量指标,包括执行性、正确性、测试结果、错误类型、Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释百分比、词符比、Shannon熵等,用于代码分析和评估。
This dataset contains various quality metrics for code samples, including executability, correctness, test results, error types, Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, type-token ratio, Shannon entropy, etc., for code analysis and evaluation.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
在代码生成与程序理解研究领域,对模型输出进行细粒度评估已成为关键环节。该数据集基于Qwen3-8B模型在策略信任机制下生成的代码样本构建而成,采样温度设为0.75,生成数量为4,运行编号为1。构建过程围绕自动化代码任务展开,通过执行测试用例并记录多项静态与动态指标,系统性地采集了每个样本的任务标识、入口点、可执行状态、正确性判断及测试通过/失败计数等结果。同时,借助代码度量工具提取Halstead系列指标、圈复杂度、可维护性指数、代码行数、注释比例等结构特征,并计算词汇丰富度、香农熵及预测熵等统计量,最终形成结构化训练数据。
使用方法
该数据集适用于代码生成质量分析、模型行为诊断及程序度量研究等场景。使用时可通过HuggingFace datasets库直接加载train划分,借助task_id和entry_point字段定位具体任务与函数入口。研究者可基于is_correct、tests_passed和tests_failed开展正确性统计,利用halstead_*、cyclomatic_complexity和maintainability_index等字段进行复杂度与可维护性相关性分析。结合token_dict、shannon_entropy和预测熵指标,可探究模型置信度与代码质量之间的关联。error_type与entry_point_repeated字段支持失败模式归类,为改进生成策略与提示设计提供数据依据。
背景与挑战
背景概述
近年来,大语言模型在代码生成领域取得了显著进展,然而模型输出的代码质量与正确性评估仍缺乏细粒度、多维度的基准数据。该数据集由匿名研究团队基于Qwen3-8B模型构建,采集了164个代码生成任务在特定解码策略下的执行与静态分析结果,涵盖可执行性、测试通过情况以及Halstead复杂度、圈复杂度、可维护性指数等软件度量指标。其核心研究问题在于揭示模型生成代码的熵特征与代码质量之间的关联,为代码生成评估提供了超越传统通过率的新视角,对推动可信代码生成研究具有基础性意义。
当前挑战
该数据集所面对的领域挑战在于,代码生成评估长期依赖二元通过率,难以刻画代码在可读性、可维护性与复杂度等方面的细微差异,而模型生成代码的预测熵与代码质量之间的映射关系尚不明确。构建过程中的挑战包括:如何统一执行环境以准确记录测试运行时间与错误类型,如何从原始代码中稳健提取Halstead度量与Shannon熵等多类指标,以及如何在小样本条件下保证各项统计量的可靠性。此外,部分字段如test_run_time_ms存在缺失,也反映出执行环境异构性带来的数据完整性问题。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集常被用于评估大语言模型在复杂编程任务上的表现。其核心使用场景聚焦于模型生成代码的可执行性与正确性验证,通过集成测试用例执行结果、代码静态度量与信息论指标,系统刻画模型输出在语法、语义及工程层面的质量。研究者借此分析模型在不同任务上的通过率与错误类型分布,进而探究模型推理策略的有效性。
解决学术问题
该数据集直面代码生成模型评估中正确性判定模糊与质量维度单一的问题。它通过细粒度测试反馈和多项代码复杂度、可维护性指标,解决了传统评估仅依赖表面匹配或简单通过率的局限。其意义在于为模型能力诊断提供多维度量化依据,推动可解释性评估方法的发展,并促进了基于执行反馈的模型优化研究。
实际应用
在实际软件开发辅助中,该数据集可用于训练与微调代码补全或自动编程工具,提升生成代码的工程可用性。其包含的可执行性、测试通过数与错误类型等信息,能帮助构建自动化代码审查与缺陷预测系统。此外,结合复杂度与熵指标,可辅助识别高风险代码片段,为持续集成与代码维护提供数据支撑。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,针对大语言模型输出代码的细粒度质量评估正成为前沿探索方向。该数据集融合了执行正确性、Halstead复杂度、可维护性指数、Shannon熵及预测熵等多维度指标,为剖析模型生成代码的语义一致性与结构合理性提供了量化基础。当前研究趋势侧重于利用此类多指标数据揭示模型规模、解码策略与代码质量间的非线性关联,并探索熵特征与错误类型之间的预测关系。在可信赖AI与自动化软件工程的交汇背景下,该数据集有助于推动鲁棒性评估基准的构建,对提升模型生成代码的可靠性及可解释性具有实证意义。
以上内容由遇见数据集搜集并总结生成



