遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务相关的数据,用于分析代码执行和复杂度。特征包括任务ID、入口点、可执行性、正确性、通过/失败的测试数量、测试运行时间(当前为空)、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、努力度和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型标记比)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量以及入口点重复标志。数据集适用于代码质量评估、软件工程研究或机器学习任务,如代码生成或缺陷检测。

This dataset contains data related to programming tasks, designed for analyzing code execution and complexity. Features include task ID, entry point, executability, correctness, number of tests passed/failed, test run time (currently null), error type, Halstead complexity metrics (e.g., vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, predictive entropy (mean and max), number of functions defined, and entry point repetition flag. The dataset is suitable for code quality assessment, software engineering research, or machine learning tasks such as code generation or defect detection.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run1_metrics 数据集图片
构建方式
该数据集的构建基于对Qwen3-4B模型在mercury基准测试上的推理结果进行系统性评估与度量分析。具体而言,通过策略名为“trust”的配置,设置温度参数为1.25、生成长度为6,并对生成的代码进行多维度自动化测评。每条数据包含任务标识、入口函数、可执行性、正确性、测试通过数与失败数、错误类型等基础验证信息,同时整合了Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释比例等软件工程领域的静态质量指标,以及香农熵与预测熵等反映模型不确定性的动态度量。数据集共包含164条训练样本,以Parquet格式存储,便于高效加载与分析。
特点
本数据集的一大特色在于其深度融合了代码执行结果与代码质量静态分析,构建起从模型输出到代码可维护性评估的完整链路。不仅记录了模型生成代码的功能正确性(如测试通过率、错误类型),还纳入了Halstead复杂度、圈复杂度与可维护性指数等经典度量,可用于研究生成代码的可靠性、健壮性与可理解性之间的关联。此外,引入了香农熵与预测熵等指标,为探究模型在生成过程中的不确定性提供了量化维度,使得对模型行为的理解不再局限于简单的正确/错误二元判断,而是能够深入洞察其预测的置信度与多样性。
使用方法
该数据集适用于多种代码智能与模型评估研究场景。用户可直接通过HuggingFace的`datasets`库加载使用,指定配置名称为“default”并以训练集split进行访问。数据可被用于训练或评估代码质量预测模型、分析代码生成模型的行为特征,或构建多任务学习框架以同时优化代码正确性与代码复杂度。各字段如`halstead_volume`、`cyclomatic_complexity`及`shannon_entropy`可作为回归或分类任务的标签或特征。对于关注模型不确定性的研究者,`mean_predictive_entropy`与`max_predictive_entropy`提供了直接的量化依据,便于进行模型校准或输出过滤策略的探索。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run1_metrics,由自噬代码(AutophagyCode)研究团队与Mercury平台合作构建,时间可追溯至Qwen3-4B模型发布之后(约2025年)。该数据集聚焦于代码生成任务中模型输出的细粒度质量评估,核心研究问题在于如何通过多维度的软件度量指标(如Halstead复杂度、圈复杂度、可维护性指数、香农熵等)量化模型生成代码的正确性、效率与可读性。其影响力体现在为代码智能领域提供了一种标准化、可复现的评估框架,填补了传统仅依赖测试通过率或人工评分的不足,尤其适用于大规模语言模型(如Qwen3系列)在可信赖代码生成场景下的性能诊断与迭代优化。
当前挑战
该数据集所解决的领域问题在于,现有代码生成评估往往忽略代码的静态质量属性(如复杂度、熵值),导致无法区分‘偶然正确’的低质量代码与高质量代码,而数据集通过引入24项工程度量指标,为评估提供更全面的视角。构建过程中面临的主要挑战包括:其一,需确保164条训练样本的多样性以覆盖不同编程任务(如算法实现、API调用等),避免过拟合于特定模式;其二,计算指标如Halstead时间与香农熵需要精确的语法解析与动态运行环境,对工具链的鲁棒性要求极高;其三,错误类型标签的标注需人工核对模型输出的运行时异常(如语法错误、逻辑错误),成本高昂且易引入主观偏差。此外,null值的处理(如test_run_time_ms字段)也增加了数据清洗的复杂性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与诊断,经典使用场景包括对大型语言模型(如Qwen3-4B)生成的代码进行多维度的质量分析。通过记录任务ID、入口点、可执行性、正确性、通过与失败的测试数量、执行时间及错误类型等信息,研究者可以系统性地评估模型在编程任务上的表现。此外,数据集还包含Halstead复杂度指标(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、注释占比、词汇重复率(TTR)、香农熵以及预测熵等静态分析特征,为深入理解生成代码的结构复杂性和信息特性提供了翔实的数据基础。
衍生相关工作
该数据集衍生了多项具有启发性的经典工作方向。其一,基于数据集中的多维度质量特征,研究者可构建代码生成模型的综合评估框架,将传统的通过率指标与Halstead复杂度、圈复杂度相结合,形成更全面的模型性能度量标准。其二,利用香农熵与预测熵等不确定性指标,衍生出代码生成过程中的置信度校准与异常检测方法,为提升模型在未知任务上的泛化能力提供新思路。其三,可维护性指数与注释占比等特征催生了代码自动重构与文档生成的研究,探索在保证功能正确性的前提下,如何引导大模型生成更具可读性和可维护性的代码。这些衍生工作共同推动了代码智能生成与软件工程实践的深度融合。
数据集最近研究
最新研究方向
该数据集聚焦于代码质量评估与可执行性验证的前沿交叉领域,通过整合哈斯泰德复杂度、圈复杂度、可维护性指数等经典软件度量指标与香农熵、预测熵等深度代码语义特征,为揭示代码理解性与执行正确性之间的复杂关联提供了高维度的量化工具。其设计理念回应了当前大型语言模型生成代码的可靠性挑战——在自动化编程工具快速迭代的背景下,如何从多模态代码特征中提取能够预测运行时失败的早期信号已跃升为关键课题。基于仅有164样本的精细标注训练集,该资源为研究小样本场景下的代码质量建模设立了基准,尤其适合探索复杂度度量与执行结果之间是否存在可迁移的统计规律,从而推动可信任AI代码生成系统的实证研究迈向更高层次。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务