遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g9_run0_metrics

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码片段的执行结果和静态分析指标,包括任务ID、入口点、是否可执行、是否正确、测试通过数、测试失败数、错误类型、Halstead复杂度指标(词汇量、长度、体积、难度、努力、时间)、循环复杂度、可维护性指数、代码行数、源代码行数、注释百分比、TTR(类型-令牌比)、令牌字典、香农熵、预测熵、定义的函数数量以及入口点是否重复等。数据仅包含训练集,共164个样本。

This dataset contains execution results and static analysis metrics for code snippets, including task ID, entry point, executable flag, correctness flag, number of tests passed/failed, error type, Halstead complexity metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, predictive entropy, number of defined functions, and whether the entry point is repeated. The dataset only includes a training split with 164 samples.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g9_run0_metrics 数据集图片
构建方式
该数据集立足于代码生成模型的性能评估需求,以Qwen3-8B模型在trust策略下针对温度参数0.75、分组数9、运行序号0所生成的代码为原始材料,通过自动化执行与测试框架对每条代码条目进行编译与单元测试,记录可执行性、正确性及测试通过情况,同时借助静态分析工具提取Halstead度量、圈复杂度、可维护性指数等程序结构指标,并计算Shannon熵与预测熵等语言模型不确定性指标,最终形成包含164个训练样本的结构化数据集。
特点
数据集涵盖多维度的代码质量与模型行为表征,特征体系包括任务标识、入口点、可执行与正确性标签、测试通过和失败计数,以及Halstead词汇量、长度、体积、难度、工作量与时间估计,圈复杂度和可维护性指数,代码行数、注释百分比、类符形符比、词元字典,Shannon熵、平均与最大预测熵,函数定义数量及入口点重复标记等。这些细粒度指标交织融合,为分析代码生成中的执行可靠性、结构复杂度与模型不确定性提供了丰富的量化依据。
使用方法
研究者可通过HuggingFace datasets库加载该数据集,利用task_id和entry_point字段定位具体编程任务,结合is_executable、is_correct及tests_passed等标签评估生成代码的功能正确性,借助Halstead度量、圈复杂度与可维护性指数刻画代码结构质量,并运用Shannon熵和预测熵指标探究模型输出的不确定性分布。数据集适用于代码生成模型的错误分析、质量预测及不确定性量化研究,可支撑模型比较与诊断性实验。
背景与挑战
背景概述
随着大语言模型在代码生成与程序合成领域的广泛应用,如何客观评估其输出代码的可执行性与结构质量成为软件工程与人工智能交叉研究的关键议题。该数据集由相关研究团队于近期构建,基于Qwen3-8B模型在特定解码策略下生成的代码样本,整合了执行正确性指标与Halstead复杂度、圈复杂度、可维护性指数、代码行数及信息熵等多维度静态与预测性度量,旨在揭示模型生成代码在功能正确性与内在质量之间的关联,为代码评估基准的细粒度分析提供实证数据支撑,对推动可信代码生成研究具有参考价值。
当前挑战
该数据集所面向的领域问题在于突破传统代码生成评估仅依赖通过率或单一正确性标签的局限,构建融合执行结果与代码结构质量的综合评判体系;其构建过程中面临多重挑战,包括执行环境与测试用例的严格对齐以确保可执行性标签的可靠性,模型生成代码在语法合法性与语义正确性之间的不一致性导致错误类型分类困难,以及从生成文本中稳定提取Halstead度量、圈复杂度与信息熵等特征时对分词策略与解析工具的高度敏感性,此外样本规模有限亦对统计推断的稳健性构成制约。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集构成了评估大语言模型生成代码质量与正确性的典型基准。其核心使用场景聚焦于对模型输出代码进行多维度的静态与动态分析,涵盖可执行性、测试通过率、Halstead复杂度度量、可维护性指数以及基于信息论的预测熵等指标。研究者借此系统性地量化模型生成代码的语法正确性、运行效率与结构合理性,为代码生成模型的性能比较提供了标准化的实验场域。
实际应用
在实际软件开发流程中,该数据集可用于自动化代码审查与质量监控系统的训练与验证。工程团队能够借助其细粒度指标构建模型生成代码的缺陷预测模型,识别高复杂度、低可维护性的风险代码段。同时,该数据集支持对模型在不同温度参数与采样策略下的输出稳定性进行压力测试,为生产环境中代码生成工具的部署参数调优提供数据支撑,助力提升AI辅助编程的可靠性与工程落地效率。
衍生相关工作
基于该数据集,后续研究衍生出多个方向的经典工作。例如,有学者利用其预测熵特征构建代码生成不确定性量化方法,以识别模型可能产生错误输出的高风险场景;亦有工作将其Halstead度量与圈复杂度作为奖励信号,用于代码生成模型的强化学习微调。此外,该数据集的结构化指标还被用于训练代码质量评估器,推动了自动化代码审查与模型自我修正机制的发展,形成了从生成到评估再到优化的研究闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务