stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g3_run1_metrics
收藏数据链接:
官方服务:
资源简介:
一个包含代码任务元数据的数据集,包括代码复杂度度量、测试结果和代码统计信息。
A dataset containing code task metadata including code complexity metrics, test results, and code statistics.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集立足于代码生成模型的系统性评测需求,围绕代码可执行性、正确性与静态度量等多维指标展开构建。通过在大语言模型推理流程中引入策略信任机制,针对每个任务生成候选代码并执行单元测试,据此逐项记录测试通过数与失败数、是否可执行与是否正确等布尔标签。同时借助静态分析工具提取Halstead度量族、圈复杂度、可维护性指数、代码行统计及注释比例等结构性指标,构成从功能验证到质量画像的完整标注体系。
使用方法
使用时可借助datasets库直接加载默认配置下的训练集,依托各字段进行多目标分析。研究者可将is_correct、tests_passed与各类代码度量联立建模,评估模型输出质量与代码结构之间的关联性;亦可依据error_type与entry_point_repeated筛选失败样本,定位重复入口点或特定错误模式。token_dict与预测熵字段支持进一步的信息论分析,从而为代码生成策略的调优与鲁棒性研究提供数据支撑。
背景与挑战
背景概述
近年来,大语言模型在代码生成与程序合成领域展现出显著潜力,如何系统评估生成代码的功能正确性与质量成为软件工程与人工智能交叉研究的关键议题。该数据集由相关研究团队于近期构建,旨在通过多维度指标刻画模型生成代码的执行表现与静态属性,核心研究问题聚焦于代码生成结果的正确性判定与可维护性分析。数据集整合了执行测试结果与Halstead度量、圈复杂度等经典软件度量指标,为理解模型生成代码的缺陷模式与质量分布提供了实证基础,对推动代码智能评估体系的标准化具有参考意义。
当前挑战
代码生成评估领域长期面临正确性验证与质量刻画的双重困难,传统方法往往依赖单一通过率而忽视代码结构复杂性与可维护性等深层属性。构建过程中,需在有限样本下协调测试用例设计、执行环境稳定性与多维度指标计算的一致性,同时处理运行时长缺失与错误类型标注等数据稀疏问题。此外,预测熵与词法多样性等指标的引入虽丰富了评估视角,却也增加了指标间语义对齐与结果可解释性的难度,对数据集在更广泛模型与任务上的泛化能力构成挑战。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集通常被用以评估大语言模型在真实编程任务上的代码生成质量与执行正确性。通过整合任务标识、入口点、执行状态、测试通过与否、Halstead度量、圈复杂度、可维护性指数等多元指标,研究者能够系统性地剖析生成代码在功能正确性、结构复杂性与可读性等维度的表现,从而为代码智能模型的训练与评测提供细粒度、可复现的基准支持。
解决学术问题
该数据集直面代码生成研究中的核心难题:如何量化评估生成代码的功能正确性与内在质量。其提供的执行反馈与多维度代码度量,有效缓解了传统评测仅依赖文本匹配或单一通过率的局限,使得研究者能够探究模型规模、提示策略与代码属性之间的复杂关联。这对推动可解释、可信任的代码智能研究具有重要方法论意义,并为程序理解与自动修复等下游任务奠定了数据基础。
实际应用
在工业级软件开发与教育场景中,该数据集可辅助构建智能编程助手与自动化评测流水线。开发团队能够借助其执行结果与复杂度指标,快速识别模型生成代码的潜在缺陷与维护风险,进而优化代码审查与测试资源分配。在教学环境中,该数据集为编程作业自动评分与个性化反馈提供了可量化的依据,有助于提升学习者的代码质量意识与调试能力。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,针对大语言模型输出代码的质量评估正从单一正确性判定转向多维度的可维护性与复杂度分析。该数据集通过整合Halstead度量、圈复杂度、可维护性指数、注释比例及Shannon熵等指标,构建了细粒度的代码质量画像,为探究模型生成代码的结构合理性与可读性提供了量化基础。当前前沿研究聚焦于利用此类指标预测代码缺陷与维护成本,并探索预测熵与生成错误之间的关联机制,从而优化解码策略与信任度校准。该数据集的出现响应了可解释AI与可信代码生成的迫切需求,对推动自动化编程工具的工业落地具有重要的实证支撑意义。
以上内容由遇见数据集搜集并总结生成



