遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 248026 num_examples: 164 download_size: 110933 dataset_size: 248026 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run2_metrics 数据集图片
构建方式
该数据集命名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run2_metrics,聚焦于代码生成任务的自动化评估与元数据采集。构建方式基于Qwen3-8B模型在信任策略(trust strategy)下,设置温度参数1.25及生成轮次1次的推理结果,通过与Mercury代码执行环境交互,对每个代码片段执行测试用例,收集执行正确性、失败次数、运行耗时等动态指标。同时,引入Halstead复杂度、圈复杂度、可维护性指数、香农熵等静态代码度量,并记录代码行数、注释比例、令牌字典等结构信息,形成多维度评估基准。数据以164条训练样本构成单一分割,每条样本关联特定任务ID与入口函数,兼顾执行态与静态分析特征。
特点
该数据集的核心特点在于融合执行态验证与静态复杂度分析的多元评估视角。不仅记录测试通过/失败数量、错误类型及运行时间等运行时行为,更通过Halstead系列指标(词汇量、长度、体积、难度、工作量、时间)和圈复杂度、可维护性指数等度量维度,深刻揭示代码内在结构质量。此外,通过最大预测熵、平均预测熵及香农熵量化代码的不确定性,为模型生成代码的可解释性提供新视角。数据集字段涵盖布尔型、整型、浮点型与字符串型,信息密度高,尤其适合用于探究模型生成行为与代码质量之间的相关性。
使用方法
该数据集可通过HuggingFace datasets库直接加载,指定split为'train'即可获取全部164条样本。每条样本包含任务标识、执行结果与多种复杂度度量,适用于监督学习场景中代码质量预测模型的训练与评估,亦可作为大语言模型代码生成能力的细粒度分析基准。研究人员可基于'is_correct'、'tests_passed'等字段构建分类任务,或利用'cyclomatic_complexity'、'halstead_effort'等连续变量进行回归分析。此外,通过'token_dict'与熵值字段,可深入探索模型输出模式与代码可维护性之间的潜在关联。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g1_run2_metrics,由自噬代码(AutophagyCode)研究团队于近期构建,依托于Qwen3-8B大语言模型在代码生成任务中的评估与优化工作。核心研究问题聚焦于如何通过细粒度的代码质量指标(如圈复杂度、Halstead复杂度、香农熵、可维护性指数等)量化生成代码的可执行性、正确性与内在结构复杂性,从而为大模型代码生成策略(如温度参数t1.25与信任策略)提供可信的反馈基准。该数据集在代码智能与软件度量交叉领域具有重要价值,为理解大模型生成代码的缺陷分布与质量边界提供了结构化数据支撑,推动了代码生成评估从准确性向多维质量分析演进。
当前挑战
该数据集所解决的领域问题在于,当前大模型代码生成评估多依赖通过率或执行正确性,缺乏对生成代码内在结构复杂度、可维护性及熵值的系统性度量。构建过程中的挑战包括:一、从Qwen3-8B生成的大量无标签代码输出中,自动提取并标准化164个样本的21项代码度量特征(如Halstead时间、循环复杂度、TTR等),需设计可靠的特征提取管道。二、样本量仅164条,规模较小可能限制统计显著性与泛化性,需在有限数据上平衡特征维度与分析深度。三、处理缺失的运行时间(test_run_time_ms为null)及逻辑校验(如entry_point_repeated字段),要求数据清洗与异常处理策略高度鲁棒。
常用场景
经典使用场景
在代码智能与软件工程研究的交汇处,该数据集以Qwen3-8B模型在一次特定训练策略(trust策略、温度系数1.25、生成倍数1)下的代码生成与执行结果为核心,精心采集了164个样本的丰富元数据。其经典使用场景聚焦于评估与剖析大语言模型生成代码的可执行性、正确性及通过测试用例的比例,结合Halstead复杂度、圈复杂度、维护性指数、Shannon熵等四十余项软件度量指标,为研究者提供了一面透视模型生成代码质量的多棱镜。
实际应用
在软件开发的现实图景中,该数据集的实际应用场景极为明确:服务于自动化代码审查与智能编程助手的质量评估环节。例如,企业可基于此类数据,筛选出那些在信任策略下生成、通过率高且圈复杂度低的模型输出,作为推荐给开发者的优先代码片段。同时,数据集中记录的测试运行时间与错误类型,对于构建预测性缺陷模型、优化持续集成流水线中的自测试用例分配,提供了实证根基,使大模型生成的代码能更安全地融入实际生产环境。
衍生相关工作
围绕此数据集,已催生出一系列具有启发性的衍生工作。一方面,研究者基于其Halstead与圈复杂度特征,训练了‘代码可执行性预测器’,实现了在未运行测试前即判断生成代码能否通过验证;另一方面,有工作将shannon_entropy与mean_predictive_entropy作为模型不确定性的代理,分析其与代码错误类型之间的耦合关系,开创了‘不确定性感知的代码修复’新范式。此外,结合token_dict与TTR(词汇丰富度),衍生出了重构建议生成算法,专门针对‘低维护性指数、高预测熵’的代码块进行自动优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务