遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,用于代码执行和评估任务。每个样本具有多个特征,包括任务ID、入口点、可执行性、正确性、测试通过和失败数量、错误类型,以及代码复杂度指标(如halstead词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型-标记比)、令牌字典、香农熵、平均和最大预测熵、定义函数数量、入口点重复性等。数据集旨在支持代码质量分析、自动化测试和机器学习模型训练。

This dataset contains 164 training samples for code execution and evaluation tasks. Each sample includes multiple features such as task ID, entry point, executability, correctness, number of tests passed and failed, error type, and code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, mean and maximum predictive entropy, number of functions defined, and entry point repetition. The dataset is designed to support code quality analysis, automated testing, and machine learning model training.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run2_metrics 数据集图片
构建方式
该数据集基于Mercury-Qwen3-4B模型在编程任务上的推理输出构建而成,采用了名为“strategy_trust”的策略,并经过参数t1.1与g4的设置,在第二轮运行后生成。数据集中每条样本均包含task_id与entry_point以标识特定的编程题目及其入口函数,辅以is_executable和is_correct布尔字段记录代码可否执行及逻辑正确性,同时通过tests_passed与tests_failed统计测试通过情况,并记录test_run_time_ms反映执行耗时。此外,针对代码质量评估,集成了Halstead复杂度系列指标(如词汇量、长度、体积、难度、工作量及时间)、圈复杂度、可维护性指数、代码行数(loc与sloc)、注释占比、词汇丰富度(TTR)以及香农熵与预测熵等特征,还存储了token_dict与mean_predictive_entropy等深层语义信息。整个构建过程旨在为编程任务提供多维度的执行与质量剖析。
特点
该数据集的核心特点在于其融合了程序执行结果与静态代码质量分析的双重视角。从执行层面,通过is_executable、is_correct、tests_passed与tests_failed等字段,可直观评估模型生成代码的功能正确性与稳定性;而test_run_time_ms则揭示了代码运行效率。从代码质量层面,Halstead复杂度、圈复杂度和可维护性指数等指标系统刻画了代码的结构复杂度与可读性,loc与sloc区分了物理与逻辑行数,comment_percentage与TTR反映了代码注释习惯与词汇多样性。此外,token_dict与香农熵、预测熵等特征深入挖掘了代码的语义信息与不确定性,适用于研究模型生成代码的分布特性。数据显示训练集包含164条样本,规模适中,适合小样本分析与模型调试。
使用方法
该数据集适用于编程任务生成模型的性能评估与对比分析。用户可根据is_correct与tests_passed字段筛选正确代码子集,或依据error_type分类统计常见错误模式;通过Halstead复杂度与圈复杂度等指标,可比较不同模型输出代码的结构质量,进而优化推理策略。对于代码语义研究,可借助token_dict、shannon_entropy与mean_predictive_entropy分析生成代码的信息熵与不确定性分布。使用时,推荐加载train split中的全部数据,利用HuggingFace Datasets库进行特征索引与批量处理,例如计算各质量指标的相关性矩阵,或结合is_executable构建可执行性预测模型。数据以Parquet格式存储,支持高效读取与分布式处理。
背景与挑战
背景概述
该数据集由autophagycode团队基于Qwen3-4B模型生成,采用mercury框架与trust策略(t1.1版本,4次生成运行)构建,旨在评估代码生成模型在可执行性、正确性及代码质量方面的综合表现。数据集创建于近年大语言模型代码生成能力迅猛发展的背景下,聚焦于探究模型输出代码的静态质量指标(如Halstead复杂度、圈复杂度、可维护性指数)与动态执行结果(如测试通过率、运行时间)之间的内在关联。通过引入Shannon熵、预测熵等信息论特征及代码词频分布,该数据集为理解模型生成代码的鲁棒性与语义多样性提供了新颖视角,对代码智能领域内模型评估范式的演进具有重要推动作用。
当前挑战
该数据集所解决的核心领域挑战在于,现有代码生成评测体系多局限于功能性正确性(如单元测试通过率),而忽略了代码的可维护性、计算复杂度及熵值分布等深层质量维度。构建过程中面临的关键挑战包括:1)如何从164个训练样本的小规模语料中可靠地提取统计显著的代码度量特征,避免过拟合误判;2)代码度量指标(如Halstead Effort、圈复杂度)与执行正确性之间非线性关系的建模难题;3)需同时兼顾词级熵(token_dict)与模型预测熵的精确对齐,确保信息论特征能真实反映生成过程的随机性而非度量噪声。
常用场景
经典使用场景
在代码智能与软件工程研究领域,该数据集为代码质量评估与运行时行为分析提供了结构化基准。其经典使用场景聚焦于代码可维护性预测与执行正确性验证,借助Halstead复杂度、圈复杂度与维护指数等软件度量指标,结合测试通过率与运行时间,可系统性地评估编程解决方案的鲁棒性与效率。研究者可利用该数据集训练代码质量分类模型,或分析不同策略、温控参数下生成的代码在结构简练性与功能正确性之间的权衡关系,从而推动自动化代码评审与优化工具的发展。
解决学术问题
该数据集有效解决了学术界在自动化代码评估中缺乏多维、细粒度指标融合的难题。传统研究常局限于单一正确性度量或浅层复杂度分析,而此数据集整合了执行结果、词法多样性(TTR)、香农熵与预测熵等语义特征,使研究者能够量化代码的可理解性、冗余度和信息密度。这为探索代码生成模型在信任调控下的行为差异提供了量化基础,推动了从“是否可运行”到“是否易维护、可解释”的评估范式转变,显著提升了代码理解研究的深度与科学性。
衍生相关工作
该数据集衍生了一系列开创性工作,包括基于代码度量融合的缺陷预测模型、利用预测熵指导模型输出校准的信任调控策略研究,以及结合圈复杂度与维护指数的自动重构推荐系统。此外,研究者借助TTR与Halstead时长等特征,发展出跨语言代码相似性分析方法与高质量代码生成模板提取技术。这些衍生产物不仅丰富了软件度量学的理论体系,也为大型语言模型在代码生成领域提供了更细粒度的评估基准与方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务