遇见数据集

autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9

收藏
Hugging Face2026-04-10 更新2026-04-11 收录
官方服务:

资源简介:

该数据集包含164个编程任务相关的结构化记录,存储于单一训练集分割中。每个样本包含16个特征字段,主要涵盖:1) 任务标识符(task_id)和入口点(entry_point);2) 程序执行状态(is_executable, is_correct)及测试结果(tests_passed, tests_failed, test_run_time_ms);3) 代码复杂度指标(halstead_vocabulary等5个Halstead度量值和maintainability_index);4) 函数定义数量(n_func_defined)和入口点重复标记(entry_point_repeated)。数据集未提供任务背景说明,但从特征设计推断适用于代码正确性验证、软件质量评估等编程相关研究。

This dataset contains 164 structured records related to programming tasks, which resides in a single training set split. Each sample includes 16 feature fields, primarily covering: 1) Task identifier (task_id) and entry point (entry_point); 2) Program execution status (is_executable, is_correct) and test results (tests_passed, tests_failed, test_run_time_ms); 3) Code complexity metrics: 5 Halstead metrics including halstead_vocabulary, as well as maintainability_index; 4) Number of function definitions (n_func_defined) and entry point repetition flag (entry_point_repeated). No task background descriptions are provided in this dataset; however, based on the feature design, it can be inferred that the dataset is suitable for programming-related research such as code correctness verification and software quality evaluation.

创建时间:
2026-04-10
原始信息汇总

数据集概述

基本信息

  • 数据集名称: autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9
  • 来源地址: https://huggingface.co/datasets/stefanocarrera/autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9
  • 下载大小: 16677 字节
  • 数据集大小: 19656 字节

数据内容与结构

  • 数据条目数量: 164 个示例
  • 数据划分: 仅包含一个“train”划分
  • 数据格式: 包含多个特征字段的结构化数据

特征字段说明

  • task_id: 任务标识符(字符串类型)
  • entry_point: 入口点(字符串类型)
  • is_executable: 是否可执行(布尔类型)
  • is_correct: 是否正确(布尔类型)
  • tests_passed: 通过的测试数量(整数类型)
  • tests_failed: 失败的测试数量(整数类型)
  • test_run_time_ms: 测试运行时间(毫秒,当前为空值类型)
  • error_type: 错误类型(字符串类型)
  • halstead_vocabulary: Halstead 词汇量(整数类型)
  • halstead_length: Halstead 长度(整数类型)
  • halstead_volume: Halstead 体积(浮点数类型)
  • halstead_difficulty: Halstead 难度(浮点数类型)
  • halstead_effort: Halstead 工作量(浮点数类型)
  • maintainability_index: 可维护性指数(浮点数类型)
  • n_func_defined: 定义的函数数量(整数类型)
  • entry_point_repeated: 入口点是否重复(布尔类型)

配置信息

  • 默认配置名称: default
  • 数据文件路径: data/train-*
搜集汇总
数据集介绍
autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9 数据集图片
构建方式
在代码生成与评估领域,autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9数据集通过系统化的方法构建而成。该数据集聚焦于编程任务的自动化评估,其构建过程涉及从特定任务集合中提取代码样本,并利用Qwen3-0.6B模型在给定学习率与配置下生成对应的代码解决方案。随后,每个生成的代码片段均经过严格的执行测试与静态分析,以收集包括可执行性、正确性、测试通过率以及多项Halstead复杂度指标在内的详细元数据,从而形成结构化的评估记录。
特点
该数据集的核心特点体现在其多维度的代码质量评估体系上。它不仅记录了代码是否可执行与正确的基本信息,还整合了丰富的软件工程度量指标,如Halstead复杂度词汇量、长度、体积、难度与努力度,以及可维护性指数和函数定义数量等。这些特征共同构成了对生成代码的结构复杂性、可读性与维护潜力的量化描述。数据集规模适中,包含164个训练样本,每个样本均关联唯一的任务标识与入口点,确保了评估的针对性与可追溯性。
使用方法
对于研究人员与开发者而言,该数据集主要用于训练与评估代码生成模型或静态分析工具。用户可通过加载数据集的训练分割,访问每个任务对应的代码生成结果及其全面的评估指标。这些数据可用于分析模型在不同编程任务上的性能表现,探究代码复杂度与正确性之间的关联,或作为基准测试集来验证新提出的代码质量评估算法。数据集的标准格式便于直接集成到机器学习流水线中,进行特征提取与模型训练。
背景与挑战
背景概述
在人工智能与软件工程交叉领域,代码生成与评估技术正经历深刻变革。数据集'autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9'由相关研究团队于近期构建,旨在系统量化与分析由大型语言模型生成的代码质量。该数据集聚焦于自动化评估生成代码的功能正确性、结构复杂度及可维护性等核心指标,通过整合Halstead复杂度度量与可维护性指数等经典软件度量学方法,为模型生成的代码提供多维度的客观评价基准。其出现响应了当前代码生成模型从单纯功能实现向高质量、可维护性代码演进的研究需求,对推动智能编程辅助工具的实用化与标准化具有重要参考价值。
当前挑战
该数据集致力于解决代码生成领域中对生成代码进行自动化、精细化质量评估的挑战。具体而言,其核心挑战在于如何超越简单的功能正确性判断,构建一套能够全面反映代码结构复杂性、可理解性与可维护性的综合评估体系。在构建过程中,研究团队面临多重困难:一是如何设计并实施可靠的自动化测试框架,以准确判定生成代码在各种边界条件下的执行正确性;二是如何有效整合多样化的软件度量学指标,如Halstead度量与可维护性指数,并确保这些指标在评估生成代码时的有效性与一致性;三是如何处理生成代码中可能出现的语法错误、运行时异常等复杂情况,并对其进行标准化分类与记录,从而保证评估结果的稳健性与可比性。
常用场景
经典使用场景
在软件工程与代码质量评估领域,autophagycode_D_metrics_he_Qwen3-0.6B_lr0.0001_scm_g9数据集为研究者提供了一个系统性的基准,用于分析代码的可执行性、正确性与维护性指标。该数据集通过整合Halstead复杂度度量、可维护性指数及测试通过率等特征,经典应用于自动化代码质量评估模型的训练与验证,尤其适用于探索代码生成、缺陷检测及重构优化等任务。其结构化特征支持对代码片段进行多维度的量化分析,为代码智能处理技术提供了丰富的数据支撑。
实际应用
在实际软件开发流程中,该数据集可被集成至持续集成与部署系统,用于实时监控代码库的质量变化。开发团队能够依据其度量指标,识别高复杂度或低可维护性的代码模块,从而优先进行重构或测试增强。此外,它还能辅助代码审查工具提供数据驱动的建议,提升团队协作效率与软件产品的长期稳定性,尤其在大型开源项目与企业级应用中具有显著价值。
衍生相关工作
基于该数据集的度量框架,衍生了一系列经典研究工作,包括代码缺陷预测模型、自动化重构建议系统以及代码复杂度与可维护性的关联性分析。这些工作进一步扩展了数据集中Halstead指标与可维护性指数的应用范围,推动了机器学习在代码质量评估中的深度融合,并为后续更细粒度的代码属性数据集构建提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务