遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g5_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务的评估数据,涵盖任务ID、入口点、可执行性、正确性、测试通过和失败数量、错误类型,以及代码复杂度度量(如Halstead词汇量、长度、体积、难度、努力值、时间,圈复杂度)、维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型-标记比)、标记字典、香农熵、平均和最大预测熵、定义函数数量、入口点重复等特征。数据用于分析代码质量、测试性能和编程任务表现,适用于代码分析、自动化评估和教育研究。

This dataset contains evaluation data for programming tasks, covering features such as task ID, entry point, executability, correctness, counts of passed and failed tests, error types, code complexity metrics (e.g., Halstead vocabulary size, length, volume, difficulty, effort, time, cyclomatic complexity), maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, average and maximum predicted entropy, number of defined functions, duplicate entry points, and more. The data is used to analyze code quality, test performance and programming task performance, and is applicable to code analysis, automated evaluation and educational research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g5_run2_metrics 数据集图片
构建方式
在代码智能与软件工程领域,对生成代码质量的全面评估是推动模型优化的核心环节。本数据集基于Qwen3-4B模型,采用一种融合信任评估与多样化生成的策略(strategy_trust),在温度系数为1.25且生成次数为5的条件下对训练集进行推理,随后对生成结果执行自动化测试与多维度度量分析而构建。数据集记录了每个样本的测试执行状态,包括是否可执行、正确性、测试通过与失败数量,并引入了Halstead复杂度、圈复杂度、可维护性指数等经典软件度量指标,同时融入了代码熵、词汇多样性等语言模型特有的评估维度。
特点
该数据集呈现出鲜明的高维代码评估特性,共包含27个字段,涵盖执行状态、复杂度度量、语义特征与结构属性四大类别。其独特之处在于,它不仅通过自动化测试将代码正确性量化为可比较的指标,还结合了Shannon熵与预测熵等深度学习视角的评估工具,为理解模型生成行为的稳健性提供了数据支撑。数据规模虽为164条训练样本,但每个样本均被细腻地标注了词法、句法与运行时的多维信息,使之成为微观层面剖析代码生成质量的宝贵资源。
使用方法
本数据集适用于多项代码智能研究任务。研究者可直接利用“is_correct”与“tests_passed”等字段训练代码正确性预测模型,或基于Halstead与圈复杂度特征构建代码质量评估器。对于语言模型生成行为分析,可借助熵值与词汇多样性指标探索模型置信度与生成模式之间的关系。数据集以Parquet格式组织,可通过HuggingFace Datasets库快速加载,仅包含训练集拆分,便于直接用于回归、分类或聚类等下游实验。
背景与挑战
背景概述
该数据集由AutophagyCode团队于近期构建,核心研究问题聚焦于代码生成模型输出质量的细粒度评估与多维度量分析。在代码智能领域,现有基准往往仅关注功能正确性,忽略了代码的可维护性、复杂度及信息论特性等软件工程关键属性。该数据集依托Qwen3-4B模型在特定策略下生成的代码样本,整合了Halstead复杂度度量、圈复杂度、维护性指数及香农熵等24项量化指标,为全面刻画代码生成模型的行为特征提供了标准化数据基础。其价值在于推动代码评估从单一正确性向多维软件质量度量转型,对代码合成、自动化调试及AI辅助编程工具的可靠性验证具有显著影响力。
当前挑战
该数据集所应对的领域挑战在于,传统代码评估体系过度依赖功能性测试通过率,未能有效度量生成代码的认知复杂度与维护成本,导致模型在工业级场景中部署时面临代码可读性差、冗余度高、异常处理薄弱等问题。数据构建过程中亦面临多重挑战:首先,需在有限样本量(164条)内平衡指标多样性,避免稀疏特征导致的统计偏差;其次,自动化提取Halstead度量、维护性指数等复杂软件工程指标时,需确保解析器对动态类型语言特性的鲁棒性;此外,模型生成代码的熵值分布与人类编写代码存在显著差异,如何校准评测基线以反映真实生产环境要求仍是未解难题。
常用场景
经典使用场景
在代码智能与软件工程研究中,该数据集聚焦于大语言模型(如Qwen3-4B)在代码生成任务中的可信性与输出质量评估。其经典使用场景涵盖对模型生成的代码片段进行系统性度量,涵盖功能性(如测试通过率、错误类型)、复杂性(如圈复杂度、Halstead度量)以及可维护性(如维护指数)等维度。研究者可借助这些指标,深入剖析模型在“信任策略”约束下生成代码的结构特征与执行表现,从而为构建更稳健的代码生成系统提供实证依据。
解决学术问题
该数据集有效回应了当前大模型代码生成领域两个核心学术挑战:如何量化模型输出在语法正确性以外的行为可信度,以及如何系统评估生成代码的软件工程属性。通过融合动态执行反馈(测试通过/失败)与静态代码度量(Halstead体积、香农熵等),数据集为探究模型策略(如温度系数t=1.25、生成数量g=5)对代码质量的影响提供了标准化分析框架。其引入的预测熵与重复检测特征,更助推了关于模型不确定性与代码唯一性之间关联的前沿讨论。
衍生相关工作
围绕该数据集的特性,已衍生出多项开创性研究。其结构化度量体系启发了可迁移的代码质量预测模型,如利用Halstead难度与维护指数联合构建回归器,估计新策略下生成代码的测试通过概率。预测熵与香农熵的对比分析,则催生了面向模型输出多样性的信息论评估方法。此外,任务级跟踪(task_id)与入口点校验(entry_point_repeated)的设计,被后续工作采纳为基准,用于消融实验以分离模型能力与策略配置对代码可信度的贡献度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务