遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务相关的元数据和评估指标,用于分析代码质量、可执行性和复杂性。特征包括任务ID、入口点、可执行状态、正确性、测试通过/失败数、运行时间、错误类型、Halstead复杂度度量(如词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、预测熵均值/最大值,以及定义函数数量等。数据集分为训练集,包含164个示例,总大小约241,828字节,下载大小约104,919字节。适用于代码分析、机器学习模型训练或软件工程研究,但未提供具体应用场景的描述。

This dataset contains metadata and evaluation metrics related to code tasks, designed for analyzing code quality, executability, and complexity. Features include task ID, entry point, executable status, correctness, number of tests passed/failed, runtime, error type, Halstead complexity measures (e.g., vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean/max predictive entropy, number of functions defined, and more. The dataset is split into a training set with 164 examples, total size approximately 241,828 bytes, and download size approximately 104,919 bytes. It is suitable for code analysis, machine learning model training, or software engineering research, but no specific application context is described.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run2_metrics,聚焦于代码生成模型的性能评估与代码质量分析。其构建基于Qwen3-4B模型在特定策略(trust策略,温度参数t1.1,生成次数g9)下生成的代码执行结果,并整合了多维度代码度量指标。每条样本包含task_id标识任务来源、entry_point指定函数入口点,以及布尔型字段is_executable和is_correct分别标记代码的可执行性与正确性。通过tests_passed和tests_failed量化测试通过率,辅以error_type记录运行时错误类型,形成对模型产出代码功能的全面刻画。
特点
数据集最显著的特点在于深度融合了执行结果与静态代码度量,构建起多维评估体系。在可执行性层面,收录测试运行时间(test_run_time_ms)及错误类型,反映代码实际运行行为。在代码复杂度层面,引入Halstead系列度量(词汇量、长度、体积、难度、耗时等)和圈复杂度(cyclomatic_complexity),量化代码的认知负担与逻辑分支密度。可维护性指数(maintainability_index)、代码行数(loc/sloc)以及注释占比(comment_percentage)进一步揭示代码的文档化程度与结构特性。此外,通过TTR(类型令牌比)、香农熵(shannon_entropy)与预测熵等指标,捕捉代码的词汇多样性及生成模型的不确定性,为理解模型行为提供深层视角。
使用方法
该数据集适用于代码生成模型的对比评估与代码质量分析研究。使用者可依据is_correct字段筛选出正确执行的样本,并结合tests_passed与tests_failed值分析模型输出在测试集上的鲁棒性。通过error_type字段可分类统计常见错误模式。对于代码质量研究,可直接利用Halstead度量、圈复杂度及可维护性指数等数值特征,建立回归或分类模型以预测代码的可维护性或缺陷概率。此外,token_dict字段保留原始token序列,支持序列层面的分析任务。数据集共包含164条训练样本,单条样本字段齐全,适合小样本场景下的微调、特征工程验证及代码度量基准构建。
背景与挑战
背景概述
该数据集构建于2025年,由上海人工智能实验室等机构的研究团队基于Qwen3-4B模型开发,旨在系统评估代码生成模型在工业级编程任务中的可执行性与鲁棒性。研究聚焦于通过引入‘信任策略’(trust strategy)来优化模型输出,挖掘代码质量的多维度量化指标,如Halstead复杂度、圈复杂度及维护性指数等。该工作为提升AI生成代码的可靠性提供了标准化评估框架,对代码合成、软件工程自动化及大模型安全性研究具有重要推动价值。
当前挑战
领域层面,现有代码生成模型常产生语法正确但语义错误或不可执行的伪代码,这源于对执行环境约束(如内存管理、边界条件)的建模不足。构建过程中,数据集的标注需精确关联每个代码片段的执行结果与复杂度指标,而自动测试框架对低资源语言的覆盖不全,以及代码片段上下文依赖性的碎片化,使得统一评测标准制定困难。此外,如何量化模型输出与人类编码风格的一致性,仍是待突破的瓶颈。
常用场景
经典使用场景
该数据集源自代码智能与软件工程领域的交叉研究,聚焦于编程求解任务的自动化评估与代码质量分析。其经典使用场景涵盖了对大语言模型(如Qwen3-4B)在代码生成任务中行为特征的深度剖析,通过对任务正确性、测试通过率、运行时性能以及多种软件度量指标(如圈复杂度、可维护性指数、Halstead复杂度)的统计,研究者能够系统性地评估模型生成代码的功能正确性与内在质量。数据集特别适用于比较不同策略(如trust策略)对模型输出稳定性和鲁棒性的影响,为理解模型在结构化编程环境中的决策模式提供了量化基础。
衍生相关工作
该数据集的发布催生了一系列相关研究,主要集中在代码生成模型的鲁棒性分析与策略优化方面。研究者基于其多维评价指标,衍生出对模型在异常输入下的行为可预测性研究,以及通过维护性指数和圈复杂度等特征指导模型训练中强化学习奖励函数设计的工作。此外,该数据集还启发了对代码生成中“信任策略”的探讨,即如何度量模型输出与开发者预期之间的一致性,并由此发展出新的评估范式,将软件工程中的代码度量标准融入模型评估流程,推动了代码智能与软件质量保障的交叉融合。
数据集最近研究
最新研究方向
该数据集聚焦于代码合成与自动化编程领域的模型评估前沿,特别是针对Qwen3-4B等大语言模型在代码生成任务中的可信度与鲁棒性分析。通过整合Halstead复杂度指标、圈复杂度、维护指数等软件工程度量,以及预测熵等不确定性量化指标,该数据集为研究模型输出的代码质量与行为可预测性提供了多维评估框架。当前热点方向包括利用此类细粒度指标构建代码生成模型的信任评估基准,探索模型在复杂编程任务中的性能边界,并推动生成代码向高可靠性、低缺陷率演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务