遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,用于代码分析或编程任务评估。每个样本代表一个代码任务,特征包括任务ID、入口点函数、可执行性、正确性、测试通过和失败数量、错误类型,以及多种代码度量指标,如Halstead复杂度(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、词汇多样性(TTR)、香农熵、预测熵(均值和最大值)、定义函数数量,以及入口点是否重复。数据集旨在支持代码质量评估、性能分析或机器学习模型训练,适用于编程语言处理或软件工程研究。

This dataset contains 164 training samples for code analysis or programming task evaluation. Each sample represents a code task, with features including task ID, entry point function, executability, correctness, number of tests passed and failed, error type, and various code metrics such as Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), Shannon entropy, predictive entropy (mean and maximum), number of functions defined, and whether the entry point is repeated. The dataset is designed to support code quality assessment, performance analysis, or machine learning model training, suitable for programming language processing or software engineering research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
该数据集源于对代码生成模型输出的系统性评估与多维分析,构建过程融合了自动化测试与软件工程度量学方法。首先,针对Qwen3-8B模型在特定策略下生成的代码片段,利用测试用例执行引擎判别其可执行性与正确性,记录通过与失败的测试用例数量及执行耗时。进而,引入Halstead复杂度参数(如词汇量、长度、体积及难度等)与圈复杂度、可维护性指数等经典软件度量指标,结合代码行数(LOC/SLOC)、注释占比及令牌级文本特征(如TTR、香农熵与预测熵),形成涵盖功能正确性与代码质量的综合性数据集。
使用方法
该数据集适用于代码生成模型的性能评估与改进研究,尤其适合分析模型输出在功能性正确性与代码可维护性之间的权衡关系。用户可直接加载JSON格式数据,利用训练集(含164个样本)进行模型输出效果的多维度诊断,或基于Halstead复杂度、圈复杂度与可维护性指数等特征开展代码质量建模、错误模式识别及生成策略优化。数据集的标注字段也支持对模型在特定类型错误(如不可执行或重复入口点)上的鲁棒性分析。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g10_run0_metrics,由研究团队在针对大语言模型代码生成能力评估的过程中创建,核心聚焦于代码动态执行后的细粒度度量分析。数据集收录了164条训练样本,每条记录不仅包含任务标识、入口函数、执行正确性等基础字段,还纳入了Halstead复杂度、圈复杂度、可维护性指数、香农熵等多项软件工程指标,从词法、结构、信息论与执行行为多个维度刻画代码质量。这种多维融合的度量体系,为量化评估和对比不同策略下模型生成代码的鲁棒性与可靠性提供了标准化基准,对推动代码智能生成系统的可解释性研究具有重要价值。
当前挑战
该数据集所解决的领域挑战主要涉及两方面。第一,现有代码生成评估多依赖静态指标或简单的通过率,难以揭示模型生成代码在可维护性、复杂性及运行时行为上的深层差异,该数据集通过集成Halstead复杂度、圈复杂度、可维护性指数等软件工程度量,弥补了这一评估盲区。第二,在数据构建过程中,需从大语言模型生成的原始代码中自动提取并计算超过20种异构特征,如何确保不同度量间的语义一致性及计算精度,避免因执行环境差异或代码结构变异导致的度量偏差,是构建过程面临的关键技术挑战。
常用场景
经典使用场景
该数据集聚焦于代码生成与自动调试任务的评估与优化,经典使用场景涵盖代码正确性验证、软件质量度量和生成式模型的性能诊断。通过收集模型生成代码的编译执行结果、测试通过率、运行时错误类型以及复杂度指标,研究者能够深入分析代码生成模型在语义正确性和鲁棒性方面的表现,从而推动代码智能领域的基准测试标准化。
解决学术问题
在学术研究中,该数据集有效解决了代码生成模型评估中缺乏细粒度结构化反馈的难题。传统指标如BLEU难以反映代码的功能正确性,而该数据集通过引入Halstead复杂度、圈复杂度、可维护性指数及测试通过率等多维度量,为探究生成代码的质量控制、错误模式识别及模型置信度校准提供了实证基础,显著促进了可信代码生成与持续集成测试的交叉研究。
实际应用
实际应用层面,该数据集可集成至自动化开发流水线中,用于实时监测代码助手生成代码的测试通过率与执行效率,辅助开发团队筛选低质量代码片段。同时,其包含的复杂度与熵值特征能用于构建代码审查预警系统,在不依赖人工介入的情况下识别高缺陷风险区域,提升工业级软件工程中的代码交付可靠性与维护效率。
数据集最近研究
最新研究方向
该数据集聚焦于代码智能领域中的生成式模型评估与鲁棒性分析,前沿方向涵盖基于执行反馈的代码正确性验证、代码复杂度与可维护性量化指标的融合分析,以及通过Halstead复杂度、圈复杂度、维护指数等多元度量刻画模型生成代码的结构质量。研究热点包括利用shannon熵与预测熵度量模型输出的不确定性,探索代码召回率(TTR)与注释密度对可理解性的影响。该数据集的意义在于为评估大型语言模型在代码生成任务中的表现提供细粒度、多维度的执行与静态分析基准,推动可靠且可解释的自动代码合成系统的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务