stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run1_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含代码样本及其相关的复杂度度量(如Halstead度量、环复杂度、维护性指数)和正确性信息,用于代码质量分析。
This dataset contains code samples along with their complexity metrics (e.g., Halstead metrics, cyclomatic complexity, maintainability index) and correctness information for code quality analysis.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集聚焦于代码生成领域的模型评估,其构建过程充分融合了自动化执行与静态分析技术。数据源自模型在特定任务上生成的代码片段,通过执行测试用例获取其功能性指标(如通过/失败测试数、运行时间),并借助Halstead复杂度、圈复杂度、可维护性指数等软件度量学指标,从词汇丰富度、结构复杂度及代码体积等多维度量化代码质量。此外,还引入了预测熵与香农熵等不确定性度量,以捕捉模型输出分布的置信度特征。数据集共包含164个训练样本,每个样本均对应唯一的任务标识与入口点函数,确保可复现性与细粒度分析能力。
使用方法
本数据集适用于代码生成模型的诊断性评估与对比分析。用户可基于task_id与entry_point定位具体任务,利用is_correct与tests_passed等字段快速评估生成代码的功能有效性。进一步地,研究者可借助Halstead系列指标与圈复杂度剖析模型输出在计算复杂度上的分布规律,通过可维护性指数与注释比例评估其在真实开发场景中的可读性与可持续性。熵值指标(shannon_entropy及预测熵)则有助于探索模型不确定性对代码质量的影响。数据以标准HuggingFace Dataset格式提供,支持通过datasets库直接加载train分割,便于集成至现有机器学习或软件分析管线中。
背景与挑战
背景概述
该数据集由自噬体编码(autophagycode)团队于近期构建,主要依托Qwen3-8B模型与Mercury策略,聚焦于代码生成任务中轻量级大型语言模型的评估与度量。数据集包含164个训练样本,涵盖任务标识、功能入口点、执行正确性、测试通过/失败数、运行时性能及多种代码质量指标,如Halstead复杂度、圈复杂度、可维护性指数和香农熵等。其核心研究问题在于如何通过细粒度代码度量与熵值分析,系统性地评估生成代码的正确性、可执行性与可维护性,为代码智能领域提供一套标准化、多维度的评估基准。该数据集对推动轻量级模型在代码生成任务中的可信度与实用性评估具有潜在影响力。
当前挑战
当前数据集面临的挑战包括:一是领域问题层面,轻量级语言模型在代码生成任务中常面临正确性与可执行性之间的权衡,现有评估多依赖单一测试通过率,难以全面反映代码的复杂结构、可读性与可维护性,亟需多维度度量方法;二是构建过程中,样本量仅为164个,规模较小,可能限制模型的泛化能力评估;同时,数据集中包含的运行时性能指标为缺失值,影响了对时间效率的精准度量;此外,领域内缺乏统一的标准来整合认知熵、可维护性指数等新型度量,导致跨模型或策略的比较存在不确定性。
常用场景
经典使用场景
在代码智能与软件工程研究领域,该数据集专注于评估大语言模型生成代码的可靠性与安全性。经典使用场景包括基于大规模语言模型(如Qwen3-8B)的代码生成任务中,通过构建包含任务标识、代码入口点、执行状态及测试通过率等核心字段的测试框架,系统性地衡量模型输出代码的功能正确性。数据集收录了164条训练样本,每条样本均详细记录了代码的Halstead复杂度指标(如词汇量、长度、体积与难度)、圈复杂度、可维护性指数及香农熵等维度信息,为研究代码生成中的质量度量提供了结构化标准,尤其适用于验证模型在“信任策略”(trust strategy)下的生成行为稳定性,推动代码生成评测从单一功能验证向多维质量评估演进。
解决学术问题
该数据集针对当前大语言模型代码生成中普遍存在的“功能正确但逻辑脆弱”问题,通过将执行状态(可执行性、测试通过/失败数)与多种静态代码复杂度指标(如Halstead难度、圈复杂度、可维护性指数)结合,为量化代码的结构健壮性提供了理论基础。研究界可借此深入探讨模型输出代码的熵特征(如平均预测熵、最大预测熵)与质量缺陷间的关联机制,揭示语言模型在不同温度参数(t1.25)和生成策略下的涌现行为差异,填补了现有代码生成评测中缺乏多维度安全性与可维护性量化分析的空白。这一数据体系的建立,推动了学术界从面向结果的正确性评测转向面向过程的可靠性评估范式。
实际应用
实际应用中,该数据集主要服务于智能编程助手与自动化软件测试场景。基于其多维度质量指标,开发者可构建代码生成模型的可靠性筛选与安全预警系统,自动识别并过滤存在高复杂度或低可维护性风险的生成代码。例如,在企业级代码补全工具中,利用数据集的圈复杂度与可维护性指数阈值设定,可有效拦截可能引发技术债务的代码片段。同时,结合Halstead时间与努力度指标,该数据集能够辅助评估生成代码的开发维护成本,为自动化代码审查系统提供量化依据,显著提升软件工程中持续集成与交付管线的质量保障能力。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在可执行性、正确性与代码质量维度的系统性评估,融入了圈复杂度、Halstead复杂度及可维护性指数等软件工程度量指标。当前前沿方向正转向基于大语言模型的代码生成在自动化测试覆盖、软件缺陷检测与逻辑严谨性方面的能力验证,特别是针对如Qwen3-8B等中型模型在复杂编程任务上的鲁棒性与可信度评估。这一研究方向与AI代码辅助工具在工业界的广泛应用紧密相关,旨在通过量化指标揭示模型生成代码的语义正确性与结构合理性,推动模型从“生成可用代码”向“生成高质量生产级代码”的范式跃迁,对评估代码合成模型的工程化落地潜力具有重要参考价值。
以上内容由遇见数据集搜集并总结生成



