遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个编程任务数据集,用于分析代码质量和机器学习模型在代码生成或评估任务中的表现。数据集包含多个特征,如任务ID、入口点、可执行性、正确性、通过/失败的测试数量、测试运行时间、错误类型、Halstead复杂度度量(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、平均预测熵、最大预测熵、定义函数数量以及入口点重复性。数据集基于训练分割,包含164个示例,总大小约243KB,下载大小约96KB。

This is a programming task dataset designed for analyzing code quality and the performance of machine learning models in code generation or evaluation tasks. The dataset includes features such as task ID, entry point, executability, correctness, number of tests passed/failed, test run time, error type, Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and entry point repetition. It is based on a train split with 164 examples, total dataset size approximately 243KB, and download size approximately 96KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run2_metrics 数据集图片
构建方式
该数据集依托于代码生成与评估任务构建而成,旨在深入分析大型语言模型在编程场景下的生成质量与行为特性。在构建过程中,以任务标识符(task_id)和函数入口点(entry_point)为锚点,对模型生成的代码进行了系统性的可执行性判定(is_executable)与正确性校验(is_correct)。通过记录通过的测试用例数(tests_passed)、失败数(tests_failed)及运行耗时(test_run_time_ms),并结合Halstead复杂度指标(如词汇量、长度、体积、难度、努力及时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc与sloc)以及注释占比(comment_percentage)等多维度度量,全方位刻画了代码的复杂度与质量。此外,还融入了TTR(型例比)、香农熵(shannon_entropy)、预测熵(mean/max_predictive_entropy)等语言学特征,以及重复函数入口点检查(entry_point_repeated),构成了一套丰富的代码评估体系。
特点
本数据集的突出特质在于其对代码质量与模型行为的深度融合分析能力。一方面,它超越了传统仅关注正确性的评估范式,通过引入Halstead复杂度、圈复杂度和可维护性指数等工程度量指标,为代码的可读性、维护性和结构优劣提供了量化依据。另一方面,它创新性地纳入了基于熵的预测不确定性指标,如平均与最大预测熵,使得模型在生成过程中的置信度与探索行为得以揭示。此外,数据集还包含了错误类型(error_type)和词元字典(token_dict)等细粒度信息,便于研究者从错误分布和词汇模式入手诊断模型短板。164条训练样本虽规模精简,但每一例均承载了多维度的结构化标注,适合用于小样本学习、模型行为诊断或合成数据评估的标杆设定。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,指定配置名称为'default',并选择'train'拆分进行调用。典型操作流程包括:首先使用load_dataset函数导入数据,随后依据task_id或entry_point进行样本筛选,以便聚焦特定任务的生成结果分析。数据集中的布尔型字段(如is_executable、is_correct、entry_point_repeated)可直接用于筛选或分组统计,例如计算代码的可执行率与正确率。对于需要深入探究代码复杂度的场景,可选取Halstead系列字段、圈复杂度或可维护性指数进行分布可视化或相关性分析。预测熵字段(mean_predictive_entropy与max_predictive_entropy)可用于对比高置信度与低置信度生成样本的代码质量差异,从而揭示模型的不确定性对输出性能的影响。数据集以Parquet格式存储,支持高效的列式读取,便于集成到机器学习工作流或性能评估管线中。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run2_metrics,由研究团队在大语言模型代码生成与评估的背景下创建,聚焦于代码质量与执行性能的细粒度度量。数据集包含164个训练样本,记录了每个任务在代码执行测试中的通过数、失败数、运行时间及错误类型,并引入了Halstead复杂度、圈复杂度、可维护性指数、香农熵等软件工程领域的经典指标,旨在为代码生成模型提供多维度、可量化的评估基准。其核心研究问题在于,如何超越传统的“通过/失败”二值判断,通过代码静态属性和动态执行特征,深入理解模型生成代码的可靠性与可维护性,从而推动大语言模型在代码生成任务中的可信落地。数据集对自动编程、代码质量评估及软件可靠性研究具有重要影响,为后续模型优化与调控策略提供了实证基础。
当前挑战
当前数据集面临的挑战主要体现在两方面。其一,在代码生成领域,模型输出的代码常出现功能正确但质量低下、可读性差或存在隐蔽缺陷的问题,而传统评估仅关注测试用例的通过率,难以捕获代码的内在复杂度与维护成本。其二,构建过程中遇到的挑战包括:如何从大量生成结果中高效筛选包含错误类型、运行时异常及结构异质性的代表性样本;如何确保Halstead、圈复杂度等软件度量指标在短小代码片段上的稳定性和合理性;此外,样本数量仅164条,小规模数据集是否足以支撑泛化的评估结论,以及如何避免因任务领域偏差导致的度量失真,均为后续研究亟待攻克的难题。
常用场景
经典使用场景
该数据集聚焦于代码生成模型输出质量的细粒度评估,尤其适用于解析与度量由大语言模型生成的代码片段。其经典使用场景在于,研究者可利用其中丰富的软件度量指标,如圈复杂度、维护性指数、Halstead复杂度系列以及代码行数等,对模型生成的代码进行系统性、多维度的质量审视。这不仅超越了简单的功能正确性判断,还能深入洞察生成代码的结构清晰度、可维护性与执行效率。此外,香农熵与预测熵的引入,为量化模型在代码生成过程中的不确定性提供了独特视角,使得该数据集成为评估与比较不同代码生成模型在可读性与鲁棒性方面表现的重要基准。
实际应用
在实际应用场景中,该数据集可作为代码辅助工具(如智能编程助手、自动化代码审查系统)的评估标尺。例如在持续集成环境中,可将模型生成的代码片段套用此数据集的分析模式,自动评估其复杂度与可维护性,辅助开发团队在合并代码前规避潜在的维护陷阱。对于安全敏感领域,香农熵与错误类型等特征可被用于识别模型生成的异常或高风险代码段,提升自动驾驶、金融系统等场景中代码合成的可信度。同时,该数据集也为教育技术提供了支撑,能够量化学生(或AI助教)所提交代码的演进质量,从而实现个性化编程反馈。
衍生相关工作
该数据集衍生了多个方向的研究工作。其一是基于Halstead和圈复杂度特征的代码质量预测模型,通过机器学习方法从数据集中学习复杂度度量与代码正确性、错误类型之间的关系,从而开发出能在不执行代码的情况下预测生成代码潜在缺陷的预筛查工具。其二是关于模型不确定性校准的研究,利用数据集中的预测熵特征,研究者正致力于设计能主动提示生成代码置信区间的对话系统,减少“幻觉”代码对用户的误导。此外,该数据集还催生了针对不同代码生成策略(如贪婪解码、束搜索)在度量指标上的对比分析,为优化推理阶段的解码参数提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务