遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个代码执行和测试评估数据集,包含编程任务的相关信息。数据集记录了每个任务的ID、入口点、可执行性、正确性、通过和失败的测试数量,以及测试运行时间(当前为空)。此外,它提供了代码复杂度度量,如Halstead指标(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数,以及代码行数(LOC和SLOC)、注释百分比、TTR(类型-标记比率)、令牌字典、香农熵、平均和最大预测熵、定义函数数量和入口点重复情况。数据集用于分析和评估代码质量、测试性能和复杂度,适用于代码分析、机器学习和软件工程研究。

This is a code execution and testing evaluation dataset containing information related to programming tasks. It records each tasks ID, entry point, executability, correctness, number of tests passed and failed, and test run time (currently null). Additionally, it provides code complexity metrics such as Halstead measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, as well as code lines (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, mean and max predictive entropy, number of defined functions, and entry point repetition. The dataset is used for analyzing and evaluating code quality, testing performance, and complexity, suitable for code analysis, machine learning, and software engineering research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run1_metrics,源自对代码生成模型输出的系统性评估与度量。构建过程首先利用大型语言模型(如Qwen3-8B)在特定推理策略(trust策略,温度参数t=1.25)下生成代码样本,随后通过自动化测试框架对生成代码进行执行验证,记录其是否可执行、测试通过率及运行时间等关键指标。在此基础上,进一步引入软件工程领域的静态代码度量方法,计算包括Halstead复杂度(如词汇量、长度、难度、工作量)、圈复杂度、可维护性指数等特征,同时融入信息论度量如香农熵、预测熵,以及代码文本特征如词符化比率(TTR)和注释百分比。最终构建出涵盖执行结果与代码质量的多维特征数据集,共计164条样本,以支持对生成代码质量的精细化剖析。
特点
本数据集最显著的特点在于其融合了执行动态特征与静态代码质量度量,构建了一个兼具实证验证与软件工程学视角的评估体系。每条样本不仅包含任务唯一标识(task_id)和入口函数(entry_point),还记录了生成代码的执行正确性(is_correct)、测试通过/失败数量及运行时间,为判断代码功能正确性提供了直接依据。同时,通过引入Halstead复杂度系列指标、圈复杂度和可维护性指数等,刻画了代码的结构复杂度与可维护性;通过香农熵、预测熵和TTR等特征,捕捉了代码的词汇丰富度与信息不确定性。这种多维度融合的设计,使得研究者能够超越简单的对错判断,深入理解模型生成代码在功能性之外的软件工程属性。
使用方法
本数据集的使用方式灵活多样,主要面向代码生成模型评估与代码质量分析研究。用户可直接加载DataFrame格式数据,利用测试通过率、可执行性等字段快速筛选正确或异常的生成结果,构建分类或回归任务以预测代码的正确性。Halstead复杂度和圈复杂度等特征可用于分析高质量代码与低质量代码在结构上的差异,或训练代码质量评分模型。此外,信息熵与预测熵特征适合探索模型推理过程中的不确定性,辅助改进生成策略。数据集仅包含训练集,共164条样本,用户可按需划分验证集或测试集,也可将其作为基准,对比不同模型、温度参数或推理策略下的生成效果。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,旨在评估大语言模型在代码生成任务中的可靠性与正确性。研究聚焦于Qwen3-8B模型在特定信任策略(trust_t1.25_g1)下的代码执行表现,通过多维度代码度量指标(如Halstead复杂度、圈复杂度、维护性指数等)量化生成代码的质量。数据集包含164个训练样本,覆盖从基本功能正确性到代码可维护性的全面评估,为探索大语言模型在软件工程领域的应用提供了精细化的数据支撑,尤其对代码生成任务中模型的可靠性与效率研究具有重要价值。
当前挑战
当前数据集面临的核心挑战在于如何有效处理大语言模型生成代码的正确性与可维护性之间的权衡。领域问题方面,代码生成任务不仅要求生成的程序通过功能性测试,还需保证代码具有较低的复杂度、良好的可维护性及可读性,这增加了评估的维度与难度。构建过程中,数据集需要平衡样本数量与度量多样性,164个样本虽聚焦于特定模型与策略,但可能不足以覆盖代码生成中常见的各种错误类型与代码模式,且对跨模型或跨策略的泛化能力评估有限,如何扩展样本规模并保持度量指标的精细度是一大难题。
常用场景
经典使用场景
该数据集汇聚了代码生成模型在编程任务上的执行结果与多维度的软件度量指标,为评估代码生成质量提供了精细化的分析框架。经典的使用场景在于,研究者可将其作为基准测试集,用以衡量不同模型在生成可执行、功能正确且具备良好软件工程属性代码方面的表现。通过对比测试通过率、圈复杂度、可维护性指数与Halstead复杂度等指标,能够系统性地剖析模型在代码功能性、可读性及效率之间的权衡,从而指导更优生成策略的设计与迭代。
解决学术问题
该数据集旨在解决代码生成领域长期存在的评估维度单一化问题。传统评价多依赖于功能正确性(如测试用例通过率),却忽视了生成代码的内在质量,如结构复杂性、可维护性与认知负荷。通过集成圈复杂度、Halstead度量族、香农熵等指标,数据集使得研究者能够深入探究模型输出在软件工程学意义上的优劣,为量化生成代码的模块化程度、理解难度及潜在缺陷风险提供了前所未有的数据支撑,推动了代码合成评估从“能否运行”向“是否优雅健壮”的学术范式演进。
衍生相关工作
基于该数据集,涌现出一系列探索代码生成质量可解释性的经典工作。研究者利用其中的可维护性指数与圈复杂度,构建了预测模型输出缺陷倾向的回归分析框架,揭示了生成策略中采样温度与代码复杂度间的非线性关联。同时,有工作将其与神经符号方法结合,将Halstead度量作为奖励信号,通过强化学习微调语言模型,促使生成器在迭代中自发倾向于低熵、高结构化的代码模式,这些衍生研究进一步夯实了代码生成自动化评估的理论根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务