遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 242726 num_examples: 164 download_size: 106406 dataset_size: 242726 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g8_run1_metrics,是在代码生成与自动评估的研究背景下构建而成。其构建过程依托于Qwen3-4B模型,采用信任策略(trust strategy)在温度参数t1.1、生成轮次g8的条件下,对名为mercury的代码评测问题进行推理生成。随后,通过自动化测试框架对生成的代码进行执行与验证,记录其是否可执行、正确性、通过测试数、失败测试数以及运行时间等执行指标。同时,基于执行结果进一步提取代码的静态属性,包括Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比等软件度量特征,从而形成一份融合执行反馈与代码质量指标的多维评估数据集。
特点
本数据集的核心特色在于将动态执行结果与静态代码度量指标有机融合,为代码生成模型的评估提供了更深层次的量化视角。其包含164条训练样本,每条样本均涵盖任务标识、入口函数、可执行性与正确性标签,以及详细的测试通过/失败计数和运行耗时。在静态特征方面,数据集提供了Halstead系列复杂度指标、圈复杂度、可维护性指数、代码行数、有效代码行数、注释百分比、文本重复率(TTR)以及香农熵和信息熵等,能够全面反映生成代码的结构复杂度、可读性和多样性。此外,还记录了预测熵分布和函数定义次数等衍生特征,有助于研究者从多个维度剖析模型输出的质量与行为特性。
使用方法
用户可通过HuggingFace Datasets库直接加载本数据集,指定配置名为'default',数据文件路径为'data/train-*',以获取包含全部164条样本的训练集。该数据集适用于以下使用场景:一是评估代码生成模型在特定任务上的执行准确性与鲁棒性;二是分析生成代码的软件质量属性,结合复杂度与可维护性指标进行深入比较;三是作为多维度回归或分类任务的数据基础,例如预测代码是否可执行、正确性标签或测试通过率。研究者可据此构建模型优化策略,如基于执行反馈与代码质量特征进行细粒度错误分析或生成质量提升。
背景与挑战
背景概述
该数据集由AutophagyCode团队构建,基于Qwen3-4B模型在代码生成任务上的推理输出,旨在系统评估生成代码的可执行性、正确性与软件质量。数据集创建于2025年,聚焦于探索大语言模型在代码合成过程中面临的可信度与鲁棒性问题。通过收录164条训练样本,每条样本不仅标注了功能测试的通过率与错误类型,还深度提取了Halstead复杂度、圈复杂度、维护性指数、香农熵等二十余项代码度量指标,为研究生成代码的结构化质量与预测不确定性提供了多维度分析基础。该数据集在推动代码智能生成评估标准从单一功能正确性向综合软件工程属性迁移方面具有奠基意义。
当前挑战
当前数据集面临的核心挑战在于构建全面、可复现的代码生成质量评估体系。其一,所解决的领域问题是如何超越传统功能测试,量化生成代码在可维护性、可理解性及执行效率等软件工程维度上的表现,现有指标(如Halstead难度、维护性指数)虽覆盖广泛,但其对大语言模型生成式代码的适应性与解释性仍需验证。其二,构建过程中需应对数据采集的稀疏性与噪声问题,150余条样本在统计意义上难以支撑复杂模型的训练需求;同时,代码度量特征的自动提取依赖于工具链的完整性,而错误类型的多样化(如运行时异常与逻辑错误混淆)给标注一致性带来了挑战。
常用场景
经典使用场景
在代码生成与软件工程领域,该数据集承载了对大规模语言模型(如Qwen3-4B)生成的代码进行系统性质量评估的重任。它通过记录每个代码片段的可执行性、测试通过率、执行时间以及错误类型,为研究者提供了衡量模型生成代码功能正确性的多维标准。同时,数据集中丰富的软件度量指标,从Halstead复杂度到圈复杂度、可维护性指数,再到香农熵和预测熵,使得对生成代码的结构化质量与内在不确定性进行定量剖析成为可能。这种双重维度的数据设计,使其成为评估和比较不同代码生成策略(如本数据集所注明的'strategy_trust')的经典基准。
衍生相关工作
该数据集的出现为一系列下游研究工作铺平了道路。基于其结构化度量,研究者可以开发预测模型,以代码的Halstead难度和圈复杂度为特征,训练回归器自动预估生成代码的测试通过概率。另一个值得关注的方向是利用数据中的熵值指标,构建不确定性感知的代码纠错系统,专门针对模型预测不自信的片段进行二次验证或提示优化。此外,领域内已初步涌现出跨模型对比研究,借助该数据集的统一评估框架,系统性地对比不同参数规模、不同训练策略(如监督微调与强化学习)的模型在生成代码的全面质量维度的优劣,进而推动更有针对性的代码生成模型训练范式的迭代。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可解释性分析,通过引入Halstead复杂度、圈复杂度、维护性指数等软件工程指标,以及预测熵、香农熵等语言模型不确定性度量,构建了多维度的代码质量与生成置信度评估框架。当前前沿方向集中于利用这些细粒度特征,探究大语言模型在编程任务中的错误模式、代码风格偏移与逻辑一致性,并与AI安全、可信代码生成等热点事件深度关联,为提升模型输出可审计性与鲁棒性提供了量化基准,对推动代码智能领域的可靠评估体系具有奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务