遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run1_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个包含164个样本的训练集,用于代码分析或软件工程任务。每个样本包括任务ID、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间(当前为空)、错误类型、Halstead软件度量(如词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(总行数和源代码行数)、注释百分比、类型-标记比(TTR)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量以及入口点重复性等特征。数据集大小为241,018字节,下载大小为96,592字节,适用于评估代码质量、复杂性或机器学习模型在编程相关应用中的性能。

This dataset is a training set containing 164 samples, designed for code analysis or software engineering tasks. Each sample includes features such as task ID, entry point, executability, correctness, number of tests passed/failed, test run time (currently null), error type, Halstead software metrics (e.g., vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, predictive entropy (mean and maximum), number of functions defined, and entry point repetition. The dataset size is 241,018 bytes with a download size of 96,592 bytes, suitable for evaluating code quality, complexity, or the performance of machine learning models in programming-related applications.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run1_metrics 数据集图片
构建方式
该数据集源自对代码生成模型输出结果的系统性评测与度量,构建过程融合了功能验证与静态代码分析两大维度。首先,通过将模型生成的代码方案置于标准化测试环境中执行,利用单元测试框架判定其可执行性、正确性及测试通过情况,并记录运行时错误类型与耗时。其次,引入Halstead复杂度度量体系,从词汇数、长度、体积、难度、工作量及期望时间等方面刻画代码的语义复杂度;同时计算圈复杂度、可维护性指数、代码行数、注释比例等软件工程指标,并结合文本熵值(如香农熵、预测熵)与词元多样性(TTR)等语言模型分析手法,形成多维度、多层次的代码质量评估组合。
使用方法
用户可直接通过HuggingFace Datasets库加载该数据集,指定配置名为'default'并获取训练集划分。数据集以字典形式组织,每条记录包含24个字段,涵盖了任务标识、功能验证结果、复杂度指标及熵值特征。利用该数据集,研究者可训练分类模型以预测代码的可执行性或正确性,亦可基于回归模型对测试通过率、维护性指数等连续标签进行建模。此外,数据结构支持便捷的过滤与可视化分析,便于通过特征工程探索代码质量与生成策略间的内在关联,从而指导下游代码生成模型的优化与选择。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,基于Qwen3-4B模型在代码生成任务中的输出,旨在深入剖析大语言模型生成代码的软件质量与复杂度特性。核心研究问题聚焦于如何量化模型生成的代码在可维护性、执行正确性及结构复杂度等方面的表现,从而为代码生成模型的评估与优化提供细粒度、多维度的度量基准。数据集涵盖从任务标识、执行结果到Halstead复杂度、圈复杂度、可维护性指数等多个软件工程指标,为相关领域的研究者提供了从传统软件度量视角审视大模型代码生成能力的独特资源,有望推动代码智能评估体系的完善与发展。
当前挑战
该数据集所解决的领域问题在于,当前大语言模型生成的代码缺乏标准化、多维度的质量评估框架,难以系统性地衡量其可维护性、执行效率与潜在缺陷。构建过程中遇到的挑战包括:如何从模型输出的海量代码中精准提取并计算多种软件度量指标(如Halstead复杂度、文字令牌比等),并确保这些指标在代码片段层级具有统计有效性与可解释性;同时,需应对代码执行环境中非确定性因素对测试结果的影响,以及如何将执行结果(如通过/失败的测试用例数)与静态度量特征有机融合,以构建反映真实代码质量的有标签数据集。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的细粒度评估与行为分析,尤其适用于探究大语言模型在代码补全任务中的表现特征与内在规律。它通过记录每道编程任务的执行状态、测试通过率、运行耗时及错误类型等关键指标,为研究者提供了一组丰富的量化维度。传统上,代码生成模型的评估往往仅关注最终正确率,而该数据集引入的复杂度指标(如圈复杂度、Halstead度量)和熵值度量(如香农熵、预测熵),使得研究者能够深入剖析模型在不同复杂度代码片段上的表现差异,揭示其在逻辑推理、代码可读性与执行稳定性等方面的隐性能力。这种结构化、多维度的评估视角,为代码智能领域的实证研究提供了坚实的数据基础。
解决学术问题
该数据集系统地解决了代码生成模型评估中缺乏可解释性与细粒度分析的核心学术问题。长期以来,研究者难以解释模型在何时、为何会生成错误代码,抑或为何在简单任务上表现优异却在复杂逻辑上溃败。通过引入Halstead复杂度、圈复杂度与维护性指数等软件工程指标,该数据集将代码的内部结构性质量纳入量化体系,使得学术界能够从代码本身的物理特性出发,探析模型生成行为的深层规律。此外,基于预测熵与香农熵的度量方式,开创性地将神经网络不确定性与代码结构复杂度联系起来,为理解模型在代码生成过程中的“盲区”提供了全新视角。这一系统性评估框架,推动了代码智能研究从简单的正确率比较迈向更富解释力的多维诊断范式。
实际应用
在实际应用中,该数据集为代码大模型的开发与部署提供了极具价值的诊断工具与性能标尺。工程团队可以借助其中记录的测试通过率、执行耗时与错误类型分布,精准定位模型在特定类型任务(如递归、循环、复杂条件判断)上的薄弱环节,从而有针对性地优化训练数据或调整模型架构。维护性指数与圈复杂度等指标,则能够在代码审查场景中辅助开发人员判断模型生成代码的长期可维护性与重构风险。同时,基于熵值度量的分析结果可用于构建代码安全预警机制,当模型在关键任务上表现出高度的预测不确定性时,系统可自动触发人工复核,从而降低生产环境中的代码缺陷风险。这种结构化评估方式,显著提升了代码生成技术从实验室走向产业落地过程中的可控性与可信赖度。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在自动化程序设计中的可信评估与可解释性分析,通过引入Halstead复杂度、圈复杂度、维护性指数、熵值等多维软件度量指标,以及测试通过率、运行时间、错误类型等执行反馈,构建了对模型生成代码的鲁棒性与效率的双重评价体系。当前前沿研究正将此类细粒度评估框架与大模型对齐策略(如RLHF、信任策略优化)深度融合,用于追溯代码生成中逻辑缺陷的根源,并结合复杂性指标优化模型训练中的奖励信号,以提升生成代码在工业级场景下的可维护性与可靠性。该方向因应大模型赋能低代码开发的热点需求,为构建可信AI编程助手提供了关键的数据基础与验证范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务