遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码质量评估和程序分析的数据集,包含164个训练示例。数据集提供了丰富的代码特征,包括任务ID、入口点、可执行性、正确性、测试通过和失败数量、测试运行时间、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、努力程度和时间)、圈复杂度、可维护性指数、代码行数(总行数和源代码行数)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量以及入口点重复性。这些特征旨在支持代码分析、测试验证和编程任务评估,适用于机器学习和自然语言处理在代码生成和质量检测中的应用。

This dataset is designed for code quality assessment and program analysis, containing 164 training examples. It provides extensive code features, including task ID, entry point, executability, correctness, number of tests passed and failed, test run time, error type, Halstead complexity metrics (such as vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, predictive entropy (mean and maximum), number of functions defined, and entry point repetition. These features are intended to support code analysis, test verification, and programming task evaluation, suitable for applications in machine learning and natural language processing for code generation and quality detection.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run2_metrics 数据集图片
构建方式
该数据集源自代码生成模型的评估过程,具体基于Qwen3-4B模型在'trust'策略下的推理结果构建。数据采集自'AutophagyCode'基准中的D级别训练子集,通过执行生成的代码片段,记录其通过测试的数量、执行时间及正确性等指标,同时融合了静态代码分析,如Halstead复杂度度量、圈复杂度及维护性指数,从而构建出一个多维度的代码质量评估数据集。
特点
数据集的特征兼具执行结果与静态分析维度,包含任务标识、代码正确性、通过/失败测试数等运行态指标,以及词汇量、长度、容积、难度、工作量等Halstead系列复杂度特征。此外,还引入了香农熵、预测熵等表征代码不确定性的度量,以及函数重复定义等结构化信息,全面刻画了生成代码的语法、语义与执行表现。
使用方法
本数据集可作为代码生成模型性能评估与调试的基准资源,适用于分析模型在不同复杂度与结构特征下的生成质量。用户可依据'is_correct'字段筛选正确与错误样本,通过复杂度特征进行错误模式聚类,或利用预测熵等指标探索模型的不确定性区域。数据以标准的HuggingFace Dataset格式存储,可直接通过'load_dataset'方法加载,便于开展后续的可视化与统计建模工作。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,旨在系统评估大语言模型(如Qwen3-4B)在代码生成任务中的可信度与代码质量。核心研究问题聚焦于模型生成的代码是否具备可执行性、功能性正确性以及结构化质量,尤其在采用特定信任策略(trust t1.1)多轮生成后的表现。数据集包含164个训练样本,涵盖了从语法级度量(如圈复杂度、Halstead复杂度)到语义熵(如香农熵、预测熵)的多元化特征,为深入剖析模型行为提供了细粒度视角。这一工作对于推动代码智能领域从单一正确性评价向多维度可信评估演进具有重要参考价值,有助于建立更严谨的模型安全性与可靠性验证基准。
当前挑战
当前数据集面临的核心挑战在于样本规模有限(仅164条),可能难以充分捕捉代码生成中的多样错误模式与模型失败边界。构建过程中,研究者需应对代码执行环境的不确定性(如不同运行时下测试通过率的波动),以及复杂度量指标(如维护性指数、预测熵)的自动计算与结果对齐精度问题。此外,缺乏跨模型对比的基线数据,使得仅凭单模型生成的评估难以泛化至更广泛的生成策略中。这些因素共同制约了数据集在揭示代码可信性生成共性规律上的解释力,亟需通过扩展样本规模、引入多模型对比、以及强化执行环境标准化来提升鲁棒性。
常用场景
经典使用场景
在程序合成与代码生成领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run2_metrics数据集被广泛用于评估和优化代码语言模型的生成质量与可靠性。该数据集以其精细的代码度量指标(如哈斯特德复杂度、圈复杂度、可维护性指数等)为特色,研究者在微调模型或设计代码生成策略时,常借助这些特征来对比不同模型在正确性、语法合规性及执行效率上的表现。它尤其适用于需要细粒度分析代码属性的场景,比如在信任策略训练中衡量生成代码的稳健性,助力模型的迭代改进。
实际应用
在实际应用中,该数据集服务于智能编程助手与自动化代码审查系统的研发。软件开发者可利用这些度量特征,训练出能优先生成低圈复杂度、高可维护性代码的模型,从而降低后续测试与维护成本。此外,数据集中的错误类型与执行耗时信息,为持续集成管道中的代码质量预警提供了训练素材。企业可将这些指标融入代码评审流程,自动识别高复杂度或潜在熵增的代码片段,提升团队协作效率与软件部署的稳健性。
衍生相关工作
该数据集衍生了一系列关于代码度量与模型信任度的研究工作。科研团队以此为基,开发了名为“信任策略”(Trust Strategy)的训练框架,通过融合可维护性指数与哈斯特德时间等特征,构建了对代码质量进行自适应评分的奖励模型。后续工作进一步拓展了数据集的维度,将其与图结构代码表示结合,提出能够预测代码执行错误的度量增强型编码器。此外,部分研究还利用其熵值指标,设计出针对低置信度生成代码的主动学习采样算法,显著提升了少样本场景下的代码合成正确率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务