遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自代码问题求解任务(如HumanEval)的样本,每个样本包括任务ID、入口函数名、代码是否可执行、是否正确、通过的测试数、失败的测试数、测试运行时间、错误类型、以及多种代码复杂度指标(如Halstead指标、圈复杂度、可维护性指数、代码行数、注释百分比等)和预测熵特征。数据集共164个训练样本,可用于分析代码质量、复杂度与正确性之间的关系。

This dataset contains samples from code problem-solving tasks (e.g., HumanEval), each including task ID, entry point function name, whether the code is executable, whether it is correct, number of tests passed, number of tests failed, test run time, error type, and various code complexity metrics (such as Halstead metrics, cyclomatic complexity, maintainability index, lines of code, comment percentage, etc.) and predictive entropy features. The dataset has 164 training samples and can be used to analyze the relationship between code quality, complexity, and correctness.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run0_metrics 数据集图片
构建方式
该数据集以代码执行为核心,通过自动化测评流程构建。首先从代码任务池中提取任务标识与入口函数,随后采用Qwen3-4B模型在指定策略(trust)及超参数(温度系数1.25、生成轮次4)下完成代码生成。对于生成的代码样本,通过执行测试用例来判定其可执行性与正确性,并记录通过/失败的测试数量及运行耗时。此外,数据集中还整合了基于Halstead度量体系的词法复杂度指标(如词汇量、长度、体积、难度、耗时)、圈复杂度、可维护性指数、代码行数统计、注释比例、文本重复率等软件工程特征,以及基于信息论的语言模型预测熵值,形成了从代码生成到质量度量的完整数据链路。
特点
本数据集兼具多维代码质量评估与生成模型行为分析的独特价值。在质量维度上,不仅提供了基础的执行正确性标签(is_correct)和测试通过率(tests_passed/failed),还系统地纳入了涵盖代码复杂度、可维护性及信息熵的20余项量化指标,为细粒度分析代码生成质量提供了丰富的特征空间。尤其值得注意的是,数据集引入了基于语言模型预测的逐词平均熵和最大熵,这些指标可能反映模型在生成代码时的置信度与不确定性,从而为研究代码生成过程中的语义稳健性提供了新颖视角。数据规模为164条训练样本,聚焦于深度分析而非大规模统计。
使用方法
此数据集适用于监督学习、模型评估与代码质量分析等场景。研究者可直接加载该数据集,利用'task_id'和'entry_point'字段关联原始任务,以'is_correct'和'tests_passed'作为核心性能标签。在特征工程中,可选取Halstead复杂度、圈复杂度、可维护性指数及熵值等连续特征构建回归或分类模型,用于预测代码质量或分析模型生成失败的模式。此外,数据集中的'token_dict'字段存储了词法单元分布信息,支持对代码生成策略进行深入的语言学分析。建议使用Python的datasets库直接读取,或通过pandas转换为DataFrame进行自定义数据分析与可视化。
背景与挑战
背景概述
该数据集由Qwen3-4B模型在特定策略下生成,专为评估代码生成任务的执行性能与代码质量而设计。数据集创建于2025年,采集了163个训练样本,每个样本不仅包含代码任务的基本信息,还融入了Halstead复杂度、圈复杂度、可维护性指数及Shannon熵等多维度的软件度量指标。研究核心在于通过细粒度的测试通过率与执行效率,量化模型生成代码的正确性与可维护性。该数据集为自动化代码生成与软件工程度量领域的交叉研究提供了关键的基准资源,尤其适用于探索大语言模型在可信代码生成中的实际表现。
当前挑战
数据集当前面临的核心挑战体现在领域问题与构建过程两个层面。在领域问题层面,大语言模型生成的代码往往缺乏可执行性与鲁棒性,该数据集通过测试执行结果与多维度质量指标,首次系统性地评估了模型代码的可靠性,但如何平衡代码正确性与可维护性仍存在矛盾。在构建过程中,数据集样本量较小且来源于单一模型,可能引入偏差,同时代码度量的计算依赖于特定的静态分析工具,不同环境下结果的再现性面临挑战。此外,token字典与熵值等特征的提取对计算资源要求较高,制约了大规模数据集的快速扩展。
常用场景
经典使用场景
在代码智能与软件工程研究领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run0_metrics数据集为评估代码生成模型的输出质量提供了精细化的度量基准。该数据集汇集了164个经过严格筛选的训练样本,每个样本不仅记录了代码的正确性(is_correct)和通过测试的数量(tests_passed),还深入刻画了代码的复杂度特征,如圈复杂度(cyclomatic_complexity)、维护性指数(maintainability_index)以及基于Halstead模型的词汇量、长度、体积、难度、工作量与时间等软件度量指标。研究者可借助这些多维度的软件工程质量属性,系统性地分析大语言模型生成的代码在功能正确性与内在结构性之间的权衡关系。
解决学术问题
该数据集核心解决了代码生成领域长期存在的“评估维度单一化”学术问题。传统上,对模型生成代码的评价往往仅依赖功能正确性,忽略了代码的可维护性、复杂度和信息熵等软件工程关键属性。通过引入Halstead复杂度度量、香农熵(shannon_entropy)以及预测性熵值(mean_predictive_entropy),该数据集使得研究者能够量化模型输出代码的认知负荷与内在不确定性。此举不仅推动了对代码生成模型“黑盒”行为的深入剖析,更为构建兼顾正确性与鲁棒性的新一代代码评估体系奠定了数据基础,其影响力辐射至代码克隆检测、缺陷预测及自动化重构等下游任务。
衍生相关工作
围绕该数据集已涌现出多项开创性研究工作。一方面,基于其软件度量特征,研究者发展了代码生成模型的“复杂度感知”蒸馏与强化学习方法,通过将环复杂度与维护性指数纳入奖励函数,显著提升了输出代码的工程可用性。另一方面,数据集中记录的熵值指标促使了关于模型预测置信度与代码质量之间关联性的探究,衍生出诸如“不确定性引导的代码采样”策略和基于Shannon熵的生成后过滤机制。此外,令牌重复率(TTR)与词性熵的组合特征被用于训练轻量级质量回归器,实现了对生成代码合规性的实时预估,推动了代码智能领域的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务