遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个示例,用于代码任务分析,涵盖任务ID、执行点、可执行状态、正确性、测试通过/失败数、测试运行时间、错误类型,以及代码复杂度指标(如Halstead词汇量、长度、体积、难度、努力度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型-标记比)、标记字典、香农熵、预测熵均值与最大值、定义函数数量、执行点重复性等特征。数据集适用于代码质量评估、执行性能分析或机器学习任务。

This dataset contains 164 examples for code task analysis, covering task ID, entry point, executable status, correctness, tests passed/failed, test run time, error type, and code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, mean and max predictive entropy, number of defined functions, and entry point repetition. It is suitable for code quality assessment, execution performance analysis, or machine learning tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run2_metrics 数据集图片
构建方式
该数据集源于对Qwen3-4B模型在特定策略配置(strategy_trust_t1.1_g8_run2)下生成的代码进行系统性评测后的结果聚合。数据集以162个训练样本构成,每个样本对应一个编程任务,并记录了模型生成的代码在多个维度的量化指标。构建过程融合了执行测试与静态分析技术,首先通过单元测试确定代码的可执行性(is_executable)、正确性(is_correct)、通过失败测试数及运行耗时,进而利用Halstead复杂度、圈复杂度、可维护性指数等度量手段,从词汇量、长度、难度、工作量及结构复杂度等视角,全面刻画代码的内在属性。同时,纳入香农熵、平均预测熵等不确定性指标,以捕捉模型生成行为中的概率特性,形成多层次的代码质量评估体系。
使用方法
本数据集适用于多种下游任务与研究场景,包括但不限于代码质量预测、生成代码的鲁棒性分析以及模型校准研究。用户可加载train分割数据,利用task_id与entry_point字段关联原始编程问题,并依据is_correct和tests_passed等布尔与数值型字段筛选高质量代码样本。研究者可利用海尔斯泰德和圈复杂度等指标构建代码复杂度预测模型,或通过香农熵与预测熵探索模型不确定性对代码正确性的影响。数据集采用102.9K压缩包存储,便于离线分析与机器学习流水线集成,支持JSON格式直接解析,满足可复现科研需求。
背景与挑战
背景概述
该数据集诞生于大语言模型代码生成能力评估的前沿探索中,由研究者利用Qwen3-4B基础模型,并融合信任策略(trust strategy)进行微调与评估构建而成。其核心研究问题聚焦于如何系统性量化模型生成代码的功能正确性与代码质量,尤其关注在自动化代码修复与生成场景下,模型输出的可靠性。通过引入Halstead复杂度指标、圈复杂度、维护指数、香农熵等多维软件工程度量,数据集为深入剖析模型生成代码的内在结构稳健性提供了宝贵资源。该工作对于推动大模型在软件工程领域的可信应用具有重要的参考价值。
当前挑战
该数据集所解决的核心领域挑战在于,现有基准测试多侧重于代码的功能性正确性(如测试通过率),而忽略了代码的可维护性与内在结构的复杂性,导致对模型生成能力的评估存在盲区。本数据集通过融合逾20项代码质量指标,揭示了仅靠测试结果无法捕捉的代码风格、冗余度及推理复杂度问题。构建过程中,研究者面临的关键挑战包括:如何在有限规模(164条样本)内确保评估的统计效力,以及如何平衡功能正确性与代码质量指标间的权重关系,避免模型为追求低复杂度而牺牲功能完整性。
常用场景
经典使用场景
在代码智能与软件工程研究的交汇领域,该数据集为评估代码生成模型的正确性与代码质量提供了精细化的评测基准。其经典使用场景聚焦于对大型语言模型生成的代码片段进行多维度剖析,不仅涵盖了代码的功能正确性验证(如测试通过率、错误类型分析),更深入到代码的内在属性,包括Halstead复杂度、圈复杂度、可维护性指数等软件度量指标。研究者可借助这些特征,系统性地考察模型输出代码的结构优雅性、可读性与维护成本,从而在功能性之外,开辟对代码非功能性属性进行量化评估的研究路径。
解决学术问题
该数据集致力于破解代码生成领域中一个长期被忽视的学术难题:如何超越单纯的功能正确性,对生成代码的软件工程属性进行系统度量。传统评测往往仅依赖测试用例的通过与否,忽略了代码本身的复杂度、可维护性与认知负荷。该数据集通过引入Halstead指标、圈复杂度及香农熵等度量,填补了这一空白,使得研究者能够量化比较不同模型、策略或微调方法所产出代码的健壮性与可理解性。这一突破对于推动代码生成模型从‘能用’走向‘好用’具有重要学术意义,为构建更符合人类编程习惯与软件工程规范的智能编程助手奠定了方法论基础。
实际应用
在现实世界的软件开发流水线中,该数据集的应用价值体现在自动化代码审查与智能辅助编程工具的效能提升上。通过分析模型生成代码的复杂度与可维护性指标,企业级代码助手能够动态调整输出风格,为开发者优先推荐结构清晰、易于扩展的代码方案。此外,该数据集还可服务于低代码平台的代码质量自动化评估环节,帮助非专业开发者在拖拽式编程中避开高复杂度、高维护成本的实现路径。在职业教育领域,该数据集可支持编程教学系统对学生提交代码进行多维度反馈,提供超越对错判定的深度素养分析,引导学习者写出更具工程美感的代码。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的可靠性评估与细粒度错误分析,融入了Halstead复杂度、圈复杂度、可维护性指数及Shannon熵等多维度代码度量指标,为深入理解大型语言模型在自动化编程任务中的行为特征提供了系统化的分析框架。当前,这一研究方向与AI辅助软件工程、智能代码审查等热点领域紧密交织,其意义在于推动代码生成系统从“功能正确”向“质量可量化”演进,进而提升自动化编程的鲁棒性与可信度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务