遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码质量评估和编程任务分析的数据集,包含164个训练样本。数据集特征包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过和失败数量(tests_passed, tests_failed),以及代码度量指标如Halstead复杂度(halstead_vocabulary, halstead_length, halstead_volume, halstead_difficulty, halstead_effort, halstead_time)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc, sloc)、注释百分比(comment_percentage)、TTR(token type ratio)、香农熵(shannon_entropy)、预测熵(mean_predictive_entropy, max_predictive_entropy)、函数定义数量(n_func_defined)、入口点重复性(entry_point_repeated)等。数据用于分析编程任务的执行结果和代码复杂度。

This dataset is designed for code quality assessment and programming task analysis, containing 164 training examples. It includes features such as task ID, entry point, executability (is_executable), correctness (is_correct), number of tests passed and failed (tests_passed, tests_failed), and code metrics like Halstead complexity measures (halstead_vocabulary, halstead_length, halstead_volume, halstead_difficulty, halstead_effort, halstead_time), cyclomatic complexity, maintainability index, lines of code (loc, sloc), comment percentage, TTR (token type ratio), Shannon entropy, predictive entropy (mean_predictive_entropy, max_predictive_entropy), number of functions defined (n_func_defined), and entry point repetition (entry_point_repeated). The data is used to analyze execution outcomes and code complexity in programming tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run0_metrics 数据集图片
构建方式
该数据集源自对代码生成模型输出质量的系统性评估与深度分析。构建过程以Qwen3-8B模型在::mercury策略下的推理结果为基础,结合::trust_t1.25_g2_run0的配置参数对生成代码进行多维度度量。数据集中每一条样本均包含任务标识、入口函数及代码可执行性标记,并通过自动化测试框架记录测试通过数、失败数、运行耗时与错误类型。进一步地,为了全面刻画代码质量,引入了Halstead复杂度系列指标(词汇量、长度、体积、难度、工作量与时间)、圈复杂度、可维护性指数、代码行数、注释比例、词汇丰富度(TTR)、香农熵及预测熵等软件工程度量,形成了对代码生成结果的立体化评价体系。
特点
本数据集最显著的特点在于其融合了执行态与静态分析的双重视角。一方面,通过::is_executable::与::is_correct::字段直接反映代码的功能正确性,::tests_passed::与::tests_failed::则量化了测试覆盖率下的表现。另一方面,多达十余种代码度量指标构成了对代码结构、可读性、复杂度与信息熵的精细刻画,例如圈复杂度反映逻辑分支密度,可维护性指数衡量代码修改难度,Halstead指标评估认知负荷,而香农熵与预测熵则从信息论角度揭示代码序列的不确定性。这些特征使得数据集不仅可用于评估模型生成结果,更能支持代码质量预测、生成模型对比等下游研究任务。
使用方法
使用该数据集时,研究人员可直接加载::train::划分的164条样本,每条样本包含完整的结构化字段,便于接入机器学习框架进行特征分析或模型训练。对于代码生成质量评估场景,可选取::is_correct::与::tests_passed::作为客观标签,构建分类或回归模型。支持通过筛选::error_type::字段对失败案例进行溯源分析,或利用::halstead_effort::、::cyclomatic_complexity::等连续变量探索代码复杂度与正确性的关联。此外,::token_dict::字段提供了代码的词汇级分布信息,适用于语言模型层面的细粒度研究。数据集以标准的HuggingFace格式存储,可通过::load_dataset::函数便捷加载,无需额外预处理。
背景与挑战
背景概述
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run0_metrics,由研究机构或团队在利用大型语言模型(如Qwen3-8B)进行代码生成与自动评估的背景下创建,专注于代码执行正确性与软件质量度量的交叉研究。数据集通过策略“trust”运行,包含164个训练样本,核心研究问题在于如何量化和预测代码生成模型在任务执行中的可信度与可靠性,尤其关注代码复杂度(如圈复杂度、霍尔斯特德指标)、可维护性指数以及执行正确性(如测试通过/失败数)之间的关系。该数据集对软件工程领域的代码质量评估、自动化测试以及大模型在编程任务中的鲁棒性研究具有潜在影响力,为探索模型输出与代码内在属性之间的关联提供了结构化数据基础。
当前挑战
该数据集面临的核心挑战包括:1) 解决代码生成任务中模型输出可信度评估的领域问题——传统代码质量指标(如圈复杂度、维护性指数)能否有效预测模型生成代码的执行正确性,仍需大量实证验证;2) 构建过程中遇到的挑战:数据规模仅164条,样本量较小可能限制统计效力和泛化能力;特征维度高且包含多种类型(布尔、整数、浮点、文本),需处理缺失值(如test_run_time_ms为null)和异构数据融合问题;此外,数据集基于特定模型(Qwen3-8B)和策略(trust)生成,其领域迁移性及对其它模型或策略的适用性尚待检验。
常用场景
经典使用场景
在代码生成与程序合成研究领域中,该数据集可作为衡量大语言模型生成代码执行正确性与鲁棒性的基准。其核心价值在于提供了细粒度的代码质量度量指标,涵盖Halstead复杂度、圈复杂度、可维护性指数等软件工程领域的经典指标,并记录了代码执行时的测试通过数、失败数、错误类型及运行时间。研究者可利用该数据集系统性地评估生成代码的功能正确性、结构复杂度及可维护性,从而深入剖析不同策略下代码生成模型的行为模式。
实际应用
在实际应用层面,该数据集可用于自动化代码审查与辅助编程工具的性能优化。软件工程师可利用数据集中的复杂度与可维护性指标,筛选出高可靠性、低技术债务的生成代码,并针对性地调整大模型的生成策略。此外,数据集中的错误类型统计可直接服务于集成开发环境中的实时缺陷预警系统,帮助开发者快速定位代码逻辑漏洞或潜在性能瓶颈。该数据集还赋能持续集成流水线,通过量化代码质量变化实现生成模型的迭代监控。
衍生相关工作
该数据集可衍生出多项前沿研究工作,例如构建代码质量预测模型,利用数据集中的Halstead度量与执行特征训练分类器,以预测生成代码在复杂测试环境下的表现。研究者还可基于此数据集开展策略空间搜索工作,通过贝叶斯优化或强化学习方法,探索温度系数、信任阈值及生成步长等超参数的最佳组合。此外,该数据集为代码可解释性研究提供了量化基础,支持分析不同复杂度指标与代码缺陷发生率之间的关联规律,推动可解释代码生成理论的深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务