遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务执行结果和代码质量评估数据,用于软件工程和代码分析研究。特征包括任务ID、入口点、可执行性、正确性、测试通过和失败数量、错误类型,以及代码复杂度指标(如Halstead词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(词型标记比)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量和入口点重复标志。数据分割为训练集,包含164个示例,总大小约247KB。

This dataset encompasses code task execution outcomes and code quality evaluation data, tailored for software engineering and code analysis research. Its features include Task ID, Entry Point, Executability, Correctness, number of passed and failed tests, Error Types, code complexity metrics including Halstead Vocabulary, Length, Volume, Difficulty, Effort and Time, Cyclomatic Complexity, Maintainability Index, Lines of Code (LOC and SLOC), Comment Percentage, TTR (Type-Token Ratio), Token Dictionary, Shannon Entropy, Predictive Entropy (mean and maximum values), Number of Defined Functions, and Entry Point Duplication Flag. The dataset is split into a training set, which contains 164 examples with a total size of approximately 247 KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run0_metrics 数据集图片
构建方式
本数据集在代码生成与智能体评估的交叉领域中构建,旨在量化分析大语言模型在编程任务上的执行表现与代码质量。基于autophagycode_D_he_train基准数据集,采用Qwen3-8B模型在特定策略配置(trust策略,温度系数t1.25,生成数g1)下运行,生成一系列候选代码片段。每条样本均经过严格的执行验证,通过运行单元测试获取通过数、失败数及运行时长的精确度量,并辅以Halstead复杂度指标(包括词汇量、长度、容积、难度、耗时等)、圈复杂度、可维护性指数、代码行数(LOC/SLOC)、注释比例、词汇多样性(TTR)、香农熵及预测熵等多元静态特征,形成对代码功能正确性与结构质量的全面刻画。数据集包含164条样本,划分为单一训练集,适用于监督学习或模型性能诊断。
特点
该数据集最为显著的特点在于融合了动态执行结果与静态代码度量两个维度的丰富信息。一方面,通过is_executable、is_correct、tests_passed及tests_failed等字段,精确记录了代码的语法正确性与逻辑正确性,error_type字段进一步标注了失败的具体类型,为错误分析与模型改进提供了直接线索。另一方面,数据集引入了全面的软件工程度量指标:Halstead系列指标从词法角度衡量代码复杂度,圈复杂度与可维护性指数评估控制流复杂度,香农熵与预测熵则捕捉代码序列的随机性与模型预测的不确定性。这种多模态特征组合使得数据集不仅可用于评估模型生成代码的正确率,更能够深入分析不同错误模式下的代码结构特征,为理解模型行为、指导提示优化与安全对齐提供数据基础。
使用方法
本数据集以HuggingFace Datasets格式组织,支持直接通过load_dataset()加载,默认配置名为default,包含一个名为train的分片,数据文件以parquet格式存储于data/train-*路径下。用户可便捷地利用其多维特征进行多种分析任务:例如,以is_correct为标签训练分类模型来预测代码正确性,或利用test_run_time_ms作为回归目标预测执行效率;也可通过Halstead复杂度与圈复杂度等特征构建聚类分析,识别不同类型错误对应的代码模式。此外,数据集的结构化特征使得它非常适合作为多任务学习或对比学习的训练语料,支持跨特征关联分析,如研究复杂度与正确率之间的相关性。注意该数据集功能专一,主要用于科学实验与模型诊断,不适合直接用于文本生成或对话系统的训练。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run0_metrics,由相关研究机构于近期创建,聚焦于代码生成与质量评估领域。其核心研究问题在于如何通过细粒度指标量化大语言模型(如Qwen3-8B)生成的代码质量,并探索信任策略对生成结果的影响。数据集包含164个训练样本,涵盖任务标识、代码可执行性、测试通过率、Halstead复杂度、圈复杂度、维护性指数及信息熵等多维特征,为代码智能研究提供了丰富的评估维度。该数据集在代码生成、软件质量分析及AI安全可信领域具有重要影响力,推动了从单一功能正确性到综合质量度量的范式转变。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:代码生成不仅要求功能正确,还需兼顾可维护性、运行效率与安全性,而现有评估体系常忽略后三者,导致模型优化偏倚。数据集构建过程中亦面临显著困难,如自动化测试环境的搭建需模拟多种执行上下文,错误类型的分类标准难以统一,以及Halstead与香农熵等指标的引入可能引入语义信息损失。此外,仅164个样本的小规模特性限制了模型的泛化能力与统计显著性,且缺乏跨语言、跨任务的评估框架,使得数据集在真实开发场景中的适用性亟待验证。
常用场景
经典使用场景
该数据集汇集了大语言模型在代码生成任务中的输出结果与多维度的软件度量指标,为评估模型生成代码的质量提供了精细化的数据基础。经典用途在于利用Halstead复杂度、圈复杂度、可维护性指数等传统软件工程指标,结合测试通过率、执行时间等执行反馈,对模型输出进行全方位的代码质量剖析。研究者可据此深入探究语言模型在生成可执行、正确且具备良好结构特征的代码方面的能力边界,从而在自动程序修复、代码补全等场景中建立更可靠的评估基准。
实际应用
在实际开发场景中,数据集所蕴含的多维度质量指标可被用于构建先进的大语言模型评测与选型工具,帮助开发团队在部署基于AI的代码助手前精准衡量其生成代码的可维护性与执行效率。同时,它可赋能持续集成/持续部署环境中自动化代码审查系统,使之能在合并请求时对AI生成的代码进行复杂度过滤与质量门禁。这些应用有助于企业在保障软件工程标准的前提下,安全、高效地引入大语言模型驱动的编程生产力提升手段。
衍生相关工作
该数据集的诞生为一系列探索代码生成质量可解释性的研究工作提供了全新素材。基于其中丰富的度量特征,衍生工作可聚焦于构建预测模型,利用圈复杂度、Halstead难度等特征对生成代码的测试通过率进行提前预估;亦可开展对比分析,揭示不同语言模型及解码策略(如温度采样、信任策略)对生成代码结构复杂度与可维护性的差异化影响。部分工作还可将其与人类开发者编写的代码进行对照,量化AI生成代码在工程化成熟度上的代差,进而指导更强大的代码合成算法设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务