遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和测试评估的数据集,包含编程任务的相关信息。数据集中的每条记录代表一个代码任务,具有任务ID、入口点、可执行性、正确性、通过和失败的测试数量等字段。此外,还包括代码复杂度度量(如Halstead度量、圈复杂度、可维护性指数)、代码行数(LOC和SLOC)、注释百分比、词汇多样性(TTR)、香农熵等特征。这些特征用于评估代码质量、可读性和复杂性。数据集分为训练集,包含164个示例,总大小约231KB,适用于机器学习或统计分析任务,例如预测代码正确性或分析代码属性。

This dataset is intended for code analysis and test evaluation, encompassing information related to programming tasks. Each record in the dataset represents a single code task, with fields including task ID, entry point, executability, correctness, counts of passed and failed tests, and others. Additionally, it includes code complexity metrics such as Halstead metrics, cyclomatic complexity, and maintainability index, alongside features like lines of code (LOC and SLOC), comment percentage, lexical diversity (TTR), and Shannon entropy. These features are used to assess code quality, readability, and complexity. The dataset is split into a training set, which contains 164 examples with a total size of approximately 231 KB. It is suitable for machine learning or statistical analysis tasks, such as predicting code correctness or analyzing code attributes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run0_metrics,是面向代码生成与执行评估的细粒度指标数据集。其构建基于Qwen3-4B模型在信任策略参数t1.25与生成次数g6条件下的输出结果,通过自动化评测流水线对每个代码任务进行静态分析与动态执行验证。静态层面提取了Halstead复杂度、圈复杂度、可维护性指数等软件度量指标,动态层面则通过测试用例执行记录测试通过数、失败数及执行时间。数据经过结构化处理后,形成包含164条训练样本的单一数据集划分,以Parquet格式存储。
特点
数据集的核心特色在于深度融合了静态代码度量与动态执行结果,提供了从代码语义复杂度到运行时表现的立体评估维度。具体包含21个字段,涵盖词汇结构(如Halstead词汇数、代码长度、体积)、复杂度(圈复杂度、维护性指数)、规模(总行数、源码行数、注释占比)以及执行效能(通过率、错误类型)。此外引入了文本多样性指标(TTR)与预测熵(香农熵、均值与最大预测熵),便于研究代码生成中的不确定性。这些多元特征使其不仅适用于代码正确性判别,更可服务于代码质量分析、模型行为诊断等研究场景。
使用方法
数据集通过HuggingFace Datasets库加载,默认配置名称为'default',数据文件位于'train'划分路径下。用户可使用load_dataset('autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run0_metrics')直接读取训练集,无需额外预处理。每条样本包含任务ID和入口函数名等标识字段,支持按task_id进行任务级检索。对于需要代码质量建模或模型生成性能分析的研究者,可基于halstead_vocabulary、cyclomatic_complexity等数值字段构建特征,或以tests_passed与tests_failed作为监督信号进行二分类或多标签学习,亦可结合token_dict字段开展代码表征分析。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,核心研究机构或团队专注于大语言模型在代码生成领域的评估与优化。数据集以Qwen3-4B模型在trust策略下生成的结果为原始材料,系统性地记录了代码片段的执行正确性、测试通过率、运行时性能以及丰富的代码度量指标,如Halstead复杂度、圈复杂度和维护指数等。其核心研究问题在于通过多维度的代码质量与性能指标,量化并分析大语言模型生成代码的可靠性与效率,为解决代码生成领域“模型输出可信度低”这一关键瓶颈提供了基准化数据平台。该数据集的影响力体现在,它首次将代码复杂度、熵值等静态度量与动态执行结果深度融合,为后续模型微调、评估基准构建以及代码生成安全性的研究奠定了方法论基础,推动了可信任代码生成领域的发展。
当前挑战
该数据集所解决的领域问题主要围绕大语言模型代码生成的可靠性挑战,即生成的代码虽在语法上正确,却可能在逻辑执行、安全漏洞或极端输入下表现不稳定,现有单一准确率指标难以全面反映代码质量。数据集通过引入Halstead复杂度、圈复杂度、维护指数等传统软件工程度量,以及信息熵和预测熵等概率模型度量,构建了多维度评估框架,以应对模型输出评判标准单一化的挑战。在构建过程中,数据集的挑战体现在规模有限,仅包含164个训练样本,这限制了泛化分析能力;同时,数据来源于单一模型和特定策略,可能引入偏差,无法全面代表多样化的生成场景。此外,对代码执行结果的自动化评估需处理复杂的依赖环境和运行错误类型分类,这增加了数据集构建的复杂性与维护成本。
常用场景
经典使用场景
在代码智能与软件工程领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run0_metrics数据集为评估大规模语言模型在代码生成任务上的表现提供了精细化的指标集合。其经典使用场景聚焦于模型生成的代码质量度量,涵盖可执行性、正确性、测试通过率、代码复杂度(如圈复杂度、Halstead度量)以及可维护性指数等维度。研究者可借助该数据集深入分析模型输出代码的语义正确性与结构性特征,从而对模型在编程任务中的鲁棒性与效能进行多角度、量化的剖析与对比。
实际应用
在实际应用层面,该数据集可助力自动化代码审查与教育辅助系统的研发。例如,利用数据集中的复杂度与可维护性指标,开发者可快速识别模型生成代码中潜在的“坏味道”或冗余结构,进而优化模型输出策略。同时,在教育场景中,该数据集支持对学习者提交的代码作业进行自动化质量评阅,涵盖从基础正确性到结构性优雅程度的全面评估,为编程教学提供数据驱动、细粒度的反馈与指导。
衍生相关工作
基于该数据集所蕴含的多维度代码度量信息,已衍生出若干值得关注的研究工作。研究者利用其中的复杂度与熵值特征,构建了预测模型生成代码失效模式的分类器,并探索了代码结构复杂性对模型推理鲁棒性的影响。此外,数据集中的可维护性指数与Halstead时间度量被用于构建代码风格迁移与质量增强的基准评估体系,进一步推动了针对代码生成模型输出质量的系统性优化方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务