遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务相关的代码质量评估数据,涵盖任务ID、入口点、可执行性、正确性、测试通过/失败数量、错误类型等基本属性,以及Halstead复杂度指标(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释比例、类型标记比(TTR)、词元字典、香农熵、预测熵均值和最大值、定义函数数量、入口点重复性等代码质量度量。数据集包含164个训练样本,适用于代码质量分析、代码生成模型评估或软件工程研究。

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run1_metrics 数据集图片
构建方式
该数据集源自对Qwen3-4B模型在信任策略引导下生成的代码执行结果的系统性度量。构建过程首先为模型提供一组编程任务,每个任务由唯一的task_id和entry_point标识。随后,通过代码执行引擎评估生成代码的可执行性(is_executable)、正确性(is_correct)以及测试通过(tests_passed)与失败数量(tests_failed),并记录运行时性能指标。在此基础上,引入多维度软件度量学分析,涵盖Halstead复杂度系列指标(如词汇量、长度、体积、难度、工作量与时间)、圈复杂度、可维护性指数、代码行数(loc与sloc)、注释百分比以及文本多样性(TTR)等。此外,还融入了信息论视角的香农熵与预测熵,以及函数定义数量与函数重复性检查,从而构建出一个融合执行反馈与静态分析的综合性评估数据集。
特点
本数据集的显著特色在于其将动态执行结果与静态代码度量有机融合。它不仅记录传统测试通过率与运行时延,更深入挖掘代码的内在复杂度与可理解性特征,如Halstead体积与工作量可反映代码的认知负荷,圈复杂度与可维护性指数则揭示代码结构与维护代价。同时,引入基于token的文本多样性(TTR)与信息熵指标,从语言学角度量化代码的冗余与不确定性。此外,数据集包含预测熵(均值与最大值),为评估模型在生成过程中的不确定性提供了独特视角。整体上,该数据集覆盖了从微观语法结构到宏观运行效能的全面评估维度,特别适用于探究大型语言模型生成代码的质量与可信度。
使用方法
使用本数据集时,可直接加载其默认配置下的训练集,该部分包含164条样本,每条样本对应一个独立编程任务的完整评估记录。用户可根据task_id或entry_point筛选特定任务实例,利用is_correct与tests_passed等字段进行正确性基准分析。对于深入研究,可重点分析Halstead系列指标与圈复杂度以评估代码的复杂性分布,或结合预测熵观察模型在不同任务上的不确定性表现。建议将本数据集作为代码生成模型的验证基准:通过对比不同模型或策略生成的度量结果,量化执行正确性与代码质量之间的权衡关系。由于数据集规模精炼且指标丰富,特别适合用于小样本下的模型对比实验或复杂度与正确性关联性分析。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,依托Qwen3-4B模型在'mercury'基准上采用特定策略生成,旨在系统评估代码生成模型的执行准确性与代码质量。数据集聚焦于细粒度的代码执行结果与静态度量指标,如测试通过率、Halstead复杂度、圈复杂度及维护性指数等,为理解生成式模型输出代码的可执行性与可维护性提供了多维度的量化视角。其研究核心在于探究语言模型生成代码在功能性正确的同时,是否具备良好的结构稳健性与低熵特性,对于推动代码智能领域的评估标准化具有示范意义。
当前挑战
当前该数据集面临的主要挑战包括:首先,现有评估体系过度依赖执行二值结果(is_correct),难以捕捉代码在边界条件或资源受限环境下的隐蔽缺陷,易导致对代码鲁棒性的高估。其次,构建过程中需应对模型生成代码的多样性带来的度量异构问题,如Halstead词汇量与圈复杂度在短函数与长函数之间分布不均,缺乏统一的归一化准则。此外,数据集样本量仅164条,限制了统计显著性,且缺乏跨模型的对比基准,使得归因分析复杂化。这些挑战共同构成了从度量收集到有效推断之间的关键鸿沟。
常用场景
经典使用场景
该数据集汇聚了Qwen3-4B模型在特定策略(trust策略,t1.1版本,第9轮)下生成的代码执行与质量评估结果,涵盖164条训练样本。经典使用场景聚焦于代码生成领域的多维度自动评估:通过记录每个代码任务的通过率、测试耗时及错误类型,辅以Halstead复杂度、圈复杂度、可维护性指数等软件工程指标,研究者可系统性地剖析模型输出代码的功能正确性、结构健壮性与可理解性。这一设计为对比不同策略或不同规模模型的代码生成能力提供了标准化、细粒度的基准。
衍生相关工作
围绕此类细粒度代码评估数据,已衍生出多项前沿工作。在模型层面,研究者基于类似指标集训练代理模型,以预测生成代码的最终通过率,从而在推理阶段实现无需执行的快速质量预估。在数据增强方向,通过分析Halstead复杂度与正确性的关联,衍生出面向低质量输出的针对性微调策略(如困难样本重采样)。此外,有工作以此类评估数据为监督信号,探索强化学习方法以直接优化模型输出的代码可维护性指数,推动代码生成向高鲁棒性、低技术债务的方向演进。
数据集最近研究
最新研究方向
当前,随着大语言模型在代码生成与自动修复领域的深度渗透,研究者开始聚焦于模型输出质量的可量化评估与调试机制。该数据集聚焦于代码执行结果与多维软件工程指标(如Halstead复杂度、圈复杂度、可维护性指数、香农熵等)的联合分析,为探究模型生成代码的可靠性与内在结构特性提供了精细化数据支撑。前沿研究方向涵盖基于代码度量驱动的模型微调策略、预测性熵值与错误类型的关联建模,以及通过复杂度特征反向优化模型推理路径。这一方向与自动化编程助手在实际部署中面临的正确性、可维护性与可解释性瓶颈紧密相连,为推动大模型从“代码生成”迈向“代码质量保障”奠定了关键的数据基础,在提升AI辅助软件工程的可信度方面具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务