遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务相关的元数据,用于代码分析和质量评估。特征包括任务ID、入口点、可执行性、正确性、测试通过/失败数量、错误类型,以及多种代码复杂度指标(如Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数),代码统计信息(如代码行数、有效代码行数、注释比例),语言多样性指标(TTR、Shannon熵),预测熵值,以及函数定义数量等。数据集可能用于机器学习模型训练,以评估代码质量、自动化测试或代码生成任务。

This dataset contains metadata related to programming tasks, designed for code analysis and quality assessment. Features include task ID, entry point, executability, correctness, number of tests passed/failed, error type, and various code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index), code statistics (e.g., lines of code, source lines of code, comment percentage), language diversity metrics (TTR, Shannon entropy), predictive entropy values, and number of function definitions. The dataset is likely used for training machine learning models to evaluate code quality, automate testing, or code generation tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run0_metrics,专注于代码执行质量与软件度量分析。其构建基于大型语言模型Qwen3-4B在特定策略下生成的代码样本,通过执行测试框架系统性地评估每个代码任务。数据集中每个样本包含任务标识符、入口函数名、可执行性标志、正确性标志、通过和失败的测试数量、运行时错误类型等执行结果,并结合Halstead复杂度指标、圈复杂度、可维护性指数、代码行数、注释率、词汇多样性、香农熵等十余种软件工程度量指标,形成对代码质量的多维度量化表征。数据集共收录164条训练样本,以结构化表格形式存储。
特点
该数据集的显著特征在于将代码执行反馈与深度静态分析指标深度融合。它既记录了代码是否通过测试及错误类型等动态行为信息,又囊括了Halstead系列指标(如词汇量、长度、体积、难度、工作量)和圈复杂度等经典软件工程度量,同时引入信息论特征如香农熵与预测熵,从复杂度、可维护性、信息密度等多视角刻画代码质量。此外,数据集中包含代码令牌字典、函数定义数量等微观结构信息,为研究代码生成模型的输出质量、错误模式及可读性提供了丰富的量化分析维度。
使用方法
该数据集适用于监督学习与代码质量评估任务,用户可通过HuggingFace datasets库加载,指定配置名为default,训练文件路径为data/train-*。每一行记录代表一个代码任务的执行与度量结果,可直接用于训练代码生成模型的正确性预测器、复杂度回归模型或可维护性分类器。建议在分析前对字符串字段如token_dict进行JSON解析,对数值型度量进行归一化处理,并注意处理test_run_time_ms列的缺失值。该数据集特别适合用于探究LLM生成代码的执行成功率与内在复杂度指标之间的关联规律。
背景与挑战
背景概述
该数据集由研究者基于Qwen3-4B模型与mercury策略构建,旨在系统评估代码生成的可靠性。其核心研究问题聚焦于通过多维度软件度量指标(如Halstead复杂度、圈复杂度、可维护性指数等)量化模型生成代码的质量与可执行性。数据集的创建填补了当前代码生成领域缺乏精细化、结构化执行结果标注的空白,为评估大语言模型在编程任务中的实际表现提供了基准资源。影响力主要体现在推动代码合成模型从简单正确性验证向可维护性、效率与复杂度平衡的纵深研究演进。
当前挑战
数据集面临的核心挑战在于代码生成可靠性评估的多维复杂性。领域层面,现有研究多依赖单一执行正确性指标,难以捕捉代码的可维护性与计算效率等深层质量特征;该数据集通过引入Halstead系列、圈复杂度等指标,试图突破这一局限。构建过程中,挑战源于自动执行框架对环境依赖的敏感性,如不同运行时配置导致的测试结果偏差,以及长尾异常类型(如内存泄漏、无限循环)的鲁棒捕获,这些因素直接影响度量数据的准确性与泛化能力。
常用场景
经典使用场景
该数据集聚焦于代码生成与智能编程助手的评估场景,尤其适用于检验大语言模型在函数级代码补全任务中的执行正确性与运行效率。通过记录每个代码片段的测试通过数、失败数及运行耗时,研究人员能够深入剖析模型所生成代码的功能完备性与性能表现。此外,数据集中囊括了圈复杂度、维护指数、Halstead度量等软件工程经典指标,为从可维护性、可读性及复杂度等多个维度综合评估代码质量奠定了坚实基础。
衍生相关工作
该数据集催生了一系列关于“代码生成模型的可信度评估”与“自适应后处理策略”的研究工作。经典衍生工作包括基于预测熵的早期错误预警机制,以及利用Halstead努力值指导测试优先级排序的探索。研究者还利用该数据构建了代码质量与执行通过率之间的回归预测模型,推动了大模型输出可信度评估从定性分析向定量预测的范式转换,引领了以复杂度与语言特征为导向的代码生成质量保障新方向。
数据集最近研究
最新研究方向
在代码智能与自动化编程的前沿探索中,该数据集聚焦于大语言模型生成代码的**可信度评估与质量度量**,紧密关联近期AI编码助手(如Codex、StarCoder)的可靠性争议。研究热点在于结合执行结果(如测试通过率、错误类型)与静态代码复杂度指标(如Halstead度量、圈复杂度、香农熵),以多维视角量化生成代码的功能正确性与可维护性。其意义在于为模型微调与推理验证提供细粒度对齐信号,推动代码生成从“语法可行”向“行为可信”跃迁,对构建鲁棒的AI编程系统具有关键路径价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务