遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务相关的结构化数据,共164个训练样本,涵盖任务标识、可执行性、正确性、测试结果(通过/失败数)、运行时间、错误类型,以及代码质量指标(如Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释比例、词汇丰富度、熵值等)。这些特征可用于代码质量分析、自动化测试评估或编程教育研究。

This dataset contains structured data related to programming tasks, with 164 training examples. It includes features such as task ID, executability, correctness, test results (number of tests passed/failed), runtime, error types, and code quality metrics (e.g., Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, lexical diversity, entropy measures). These features can be used for code quality analysis, automated testing evaluation, or programming education research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run0_metrics,旨在评估代码生成模型的性能与代码质量。其构建源于对Qwen3-4B模型在特定信任策略(trust)及温度参数1.25、生成条数9的设定下,针对代码补全任务的输出结果进行系统性分析。数据集以任务标识(task_id)和入口点(entry_point)锚定每个样本,通过执行测试用例获取可执行性(is_executable)、正确性(is_correct)、通过及失败测试数等执行指标,并记录运行时间与错误类型,从而构建起多维度评估框架。
特点
该数据集的显著特色在于深度融合了代码执行结果与静态质量度量。除基本执行正确性外,纳入了Halstead复杂度系列指标(如词汇量、长度、体积、难度、耗时)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)以及代码行数(loc、sloc)与注释比例等软件工程度量。更引入词元多样性(TTR)、香农熵(shannon_entropy)及预测熵序列,从信息论视角刻画代码内部的语义复杂度与不确定性。同时记录函数定义数量及入口点重复性,为研究代码生成的结构冗余提供依据。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,采用默认配置即直接读取存储于'train'分片的parquet或arrow格式文件。数据集中每一行的原始字段为字符串,使用者可直接解析执行指标列(如tests_passed、error_type)进行性能分析,或利用代码复杂度特征(如halstead_effort、maintainability_index)开展代码质量研究。推荐根据task_id分组进行细粒度分析,或结合任务难度(通过halstead_vocabulary与cyclomatic_complexity)分层评估模型生成能力,亦可将token_dict与shannon_entropy用于探索代码信息密度与生成分布特性。
背景与挑战
背景概述
该数据集由 autophagycode 团队于近期构建,旨在系统评估代码生成模型在算法编程任务中的执行正确性与代码质量。数据集围绕 Qwen3-4B 模型在特定策略(信任度阈值 1.25、生成次数 9)下的输出,记录了 164 个训练样本的细粒度执行结果与 22 项代码度量特征。其核心研究问题聚焦于如何通过多维度量化指标(如 Halstead 复杂度、圈复杂度、可维护性指数及香农熵)来剖析模型生成代码的可靠性、效率与可理解性。该数据集为代码智能领域提供了从语法、语义到执行性能的立体评估框架,推动了自动化代码生成质量评测从简单正确性判断向深层软件工程属性的演进,对理解大语言模型在编程场景中的行为模式具有关键参考价值。
当前挑战
当前代码生成领域面临的核心挑战在于如何客观衡量模型输出在真实软件开发中的实用价值。该数据集所解决的领域问题包括:单纯依赖测试用例通过率可能掩盖代码在可维护性、计算效率或安全风险方面的缺陷,而现有评估体系往往忽视代码复杂度(如 Halstead 难度、圈复杂度)与可读性(如注释率、语句密度)等工程属性。在构建过程中,研究者需应对以下具体难题:自动化执行环境需模拟多样化的测试用例与边界条件,以确保对正确性评估的完整性;对代码质量度量的计算(如符号熵、预测熵)需在细粒度 token 级别上对齐模型概率分布与标准答案;此外,数据集规模仅含 164 个样本,可能限制统计显著性与泛化性分析,需谨慎处理特征稀疏性与多维度度量间的共线性问题。
常用场景
经典使用场景
该数据集汇聚了164个经过代码执行验证的编程任务样本,每个样本均记录了任务唯一标识、入口函数名称、可执行性、通过及失败的测试用例数量、运行时耗等信息。尤为珍贵的是,数据集中融入了Halstead复杂度指标、圈复杂度、可维护性指数、代码行数、注释比例、文本重复率(TTR)以及香农熵与预测熵等十余项软件度量维度。这种多维度的代码质量刻画,使其成为评估大语言模型在代码生成任务中语义正确性与代码质量之间权衡的经典基准。研究者常利用该数据集分析模型生成的代码是否兼具功能完整性与结构优雅性,并量化模型在不同复杂度任务上的表现差异。
实际应用
在软件工程实践中,该数据集可无缝嵌入自动化代码审查与质量保障流程。开发团队可利用其历史数据构建预测模型,评估新生成的代码补丁可能存在的复杂度风险,从而提前识别需要重构的模块。此外,数据集中的可执行性标记与测试通过率可直接服务于持续集成(CI)管线的代码质量门禁,辅助工程师筛选出高可靠性、低维护成本的代码。教育领域亦能受益:通过分析学生提交的编程作业在该度量空间中的分布,教师可设计更有针对性的教学干预,提升学生的代码设计素养。
衍生相关工作
围绕这一数据集,研究社区已衍生出多个关键工作方向。一是基于复杂度感知的模型微调方法,通过在训练过程中引入可维护性指数等辅助损失项,引导模型生成更简洁高效的代码。二是预测不确定性校准模型,利用香农熵与预测熵的差异,修正模型对复杂任务的置信度输出。三是代码克隆检测与重构推荐系统,借助Halstead度量与TTR的联合分析,自动定位重复率过高的代码片段并推荐重构策略。这些衍生工作共同构成了从静态度量分析到动态代码优化的技术生态,拓展了数据集在软件质量保障中的源头价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务