遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个编程任务样本,每个样本记录任务ID、入口点、可执行性、正确性、测试通过/失败数、错误类型等基本属性,并提供了丰富的代码质量评估指标,包括Halstead复杂度度量(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、词汇多样性(TTR)、香农熵、预测熵均值与最大值、定义函数数量及入口点重复标志。数据集适用于代码质量分析、自动化测试评估、编程教育辅助和软件工程研究。

This dataset contains 164 programming task samples, each recording basic attributes such as task ID, entry point, executability, correctness, tests passed/failed, and error type. It provides comprehensive code quality assessment metrics including Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, lexical diversity (TTR), Shannon entropy, mean and maximum predictive entropy, number of defined functions, and entry point repetition flag. The dataset is suitable for code quality analysis, automated testing evaluation, programming education support, and software engineering research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run2_metrics 数据集图片
构建方式
在代码智能研究领域,自动化评估代码生成质量是提升大语言模型性能的关键环节。该数据集源自对Qwen3-8B模型在特定推理策略下生成代码的度量结果,汇集了164条训练样本。每条样本包含任务标识符、入口函数名称、可执行性标志、正确性判定、测试通过与失败计数、错误类型等运行时反馈,同时融入了Halstead复杂度指标(包括词汇量、长度、体积、难度、工作量及时间)、圈复杂度、可维护性指数、代码行数与注释比例、词汇丰富度(TTR)、Shannon熵与预测熵、函数定义数量等静态特征。数据通过提取模型在“trust”策略下(温度1.25,生成次数2)的输出,并结合自动化执行测试与静态分析工具生成,形成了对代码质量的多维度刻画。
特点
该数据集的核心特色在于将运行时动态信息与静态代码复杂度指标深度融合,提供了对生成代码质量的立体评估。具体而言,它不仅记录了测试通过率与执行时间等执行反馈,还纳入了Halstead系列指标与圈复杂度,使研究者能够从认知负荷与结构复杂性角度分析代码。此外,词法层面的TTR与熵值度量捕捉了代码的多样性,而可维护性指数与注释百分比则反映了代码的可读性。这些特征共同构成了一个精细化的代码质量画像,尤其适用于分析语言模型在不同推理策略下的生成偏好与缺陷模式。
使用方法
本数据集适用于代码生成模型的评估与对比分析。用户可利用task_id与entry_point定位具体编程任务,结合is_correct与tests_passed等字段进行正确性统计。进一步地,Halstead与圈复杂度指标可用于分析模型生成代码的复杂性倾向,而熵值特征则有助于探测模型推断的不确定性。推荐将其接入机器学习流水线,作为回归或分类任务的特征输入,用于预测生成代码的可靠性;也可用于可视化分析,对比不同生成策略下代码质量特征分布的差异。数据以JSON格式存储于HuggingFace Datasets框架中,支持直接使用load_dataset()函数加载。
背景与挑战
背景概述
该数据集由autophagycode团队在近期创建,依托Qwen3-8B模型,采用名为“mercury”的策略框架,在信任阈值为1.25、生成次数为2的运行环境下构建而成。其核心研究问题聚焦于评估和量化大型语言模型生成代码的质量与可靠性,特别关注代码的可执行性、正确性以及通过复杂测试的能力。通过引入Halstead复杂度、圈复杂度、可维护性指数、Shannon熵等多元度量指标,该数据集为深入剖析模型输出代码的语义准确性、结构健壮性与计算效率提供了系统化的评估基准,在代码生成与自动编程领域具有重要参考价值。
当前挑战
该数据集所解决的领域挑战在于,大型语言模型生成的代码往往存在语法正确但逻辑错误、边界条件处理缺失或效率低下的问题,而传统评估方法难以全面捕捉这些细微缺陷。为此,数据集构建过程中面临多重挑战:首先,如何设计和选取能够反映代码内在质量的多维度度量指标,如Halstead复杂度与可维护性指数的有效组合;其次,在仅有164个训练样本的条件下,如何确保测试的分布覆盖率与统计显著性;最后,需要精确区分“可执行但测试未通过”与“完全无法执行”的错误类型,这要求对错误类型进行细粒度分类和标注。
常用场景
经典使用场景
在代码智能与软件工程领域,autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run2_metrics数据集为评估和改进代码生成模型的性能提供了坚实的数据基础。该数据集汇集了164个训练样本,每个样本涵盖任务标识、入口函数、执行状态、测试通过率、运行时错误类型及代码长度等结构化信息,尤为重要的是,其囊括了哈斯泰德复杂度、圈复杂度、可维护性指数、香农熵等多项软件度量指标。这些多维特征使得该数据集能够系统性地刻画代码质量与模型生成行为之间的关联,典型应用于代码生成模型的微调与评估、代码复杂度预测、以及基于度量指标的模型行为分析与优化,成为连接自然语言与编程语言的重要桥梁。
实际应用
在实际应用中,该数据集可用于持续集成与自动化代码审查系统的构建。企业软件开发团队可以借助数据集中的度量特征,快速评估AI辅助编程工具(如GitHub Copilot、CodeWhisperer)所生成代码的易理解性与潜在维护成本,从而在开发早期发现并规避技术债务风险。此外,基于该数据集训练的模型能够自动标注代码的复杂度等级与可维护性评分,辅助开发者优化重构策略。教育领域同样可受益于此,通过对学生提交的编程作业进行多维度度量分析,实现个性化学习反馈与教学方法迭代。
衍生相关工作
围绕此数据集,一系列衍生工作已逐步展开。一方面,研究者基于其度量信息开展了代码生成鲁棒性分析,探索不同解码策略(如束搜索与核采样)在生成代码自愈能力上的差异。另一方面,圈复杂度与可维护性指数被用于指导解释伴侣模型的构建,旨在让大语言模型在生成代码的同时输出可理解的复杂度报告,推动“白盒化”代码生成。此外,基于哈斯泰德体积与香农熵的特征工程催生了代码质量预筛选框架,显著提升了后续测试用例生成与缺陷定位的效率。这些工作共同促进了代码智能领域的度量驱动研究生态的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务