遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 243166 num_examples: 164 download_size: 106977 dataset_size: 243166 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run0_metrics 数据集图片
构建方式
本数据集是基于Qwen3-4B模型在autophagycode_D_he_train-mercury任务上采用特定推理策略(trust策略,t1.1参数,g1生成模式)进行零次运行后生成的评测中间结果集合。构建过程聚焦于代码自动修复场景,通过对模型输出的程序代码进行多维度静态与动态分析,记录其执行正确性、运行时间、错误类型及多种软件工程度量指标,将原始模型输出转化为结构化评测数据。
特点
数据集融合了代码可执行性、功能正确性等动态评估信息,与Halstead复杂度、圈复杂度、维护性指数等静态代码度量指标,创新性地引入TTR(标记类型比率)和多种信息熵度量。这种多维度特征体系既涵盖传统代码质量分析,又包含基于信息论的预测不确定性度量,为深入理解代码生成模型的行为特性提供了丰富视角。
使用方法
数据集以164条训练样例构成,每条记录包含task_id标记和entry_point函数入口,支持按任务维度进行模型性能分析。使用者可直接加载JSON格式数据,按需提取正确性标签、复杂度指标或熵值进行统计分析。尤其适用于评估代码生成模型在不同代码质量维度下的表现差异,或作为基准数据集进行对比实验的评测基础。
背景与挑战
背景概述
该数据集由研究团队在代码智能与软件工程交汇领域构建,旨在系统评估大语言模型(如Qwen3-4B)在代码生成任务中的可信任度与质量。数据集核心围绕“信任策略”这一创新概念展开,通过记录模型生成代码的执行正确性、测试通过率、错误类型及多种软件度量指标(如Halstead复杂度、圈复杂度、可维护性指数、香农熵等),为理解模型行为的可靠性与鲁棒性提供多维视角。其创建时间与研究人员信息未在README中明确,但数据集名称暗示其源自代码自动修复或代码生成评测的专项实验,对推动可信代码生成、智能编程助手的安全部署具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,当前代码生成模型虽能生产语法正确的代码,但缺乏对生成结果可执行性、正确性与内在复杂度的系统度量,导致模型信任度难以量化。构建过程中面临的核心挑战包括:1) 设计合理的多维度评价指标体系,综合代码质量(如圈复杂度、可维护性指数)与预测不确定性(如香农熵、预测熵);2) 平衡数据规模与标注成本,仅164个训练样本即需涵盖多种错误类型与复杂度层级;3) 协调执行环境差异,确保代码运行时间、测试通过率等指标的跨平台可复现性;4) 统一不同代码结构下的度量标准,如处理递归函数与循环的圈复杂度计算差异。
常用场景
经典使用场景
在程序合成与代码生成领域,该数据集作为评估模型生成代码正确性与执行效率的基准而备受青睐。它集成了丰富的代码质量度量指标,如圈复杂度、Halstead难度与维护性指数,使研究者能够在功能正确性之外,深入剖析生成代码的语法复杂度与可维护性。数据集中任务标识符(task_id)与入口点(entry_point)的设定,便于进行细粒度的代码功能对应分析,而测试通过率与执行时间则直观反映模型输出的鲁棒性与运行效能。因此,它常被用于对比不同规模语言模型在代码生成任务上的表现,成为衡量模型代码智能水平的经典测试平台。
实际应用
该数据集的实际应用场景贯穿软件开发的自动化流程。在持续集成环境中,开发者可借助其对自动生成的代码补丁进行质量审查,通过复杂度指标快速识别潜在的脆弱代码。在智能编程助手的构建中,数据集作为训练与验证素材,帮助模型在生成代码时兼顾功能完备性与代码健壮性。例如,企业级代码辅助系统利用其维护性指数与测试通过率,优化代码建议的质量排序,确保推荐给用户的代码不仅可运行,更具备优秀的可读性与低缺陷风险。
衍生相关工作
围绕该数据集,一批具有启发性的研究工作应运而生。部分学者基于其代码复杂度指标,提出了融合Halstead与圈复杂度的多目标优化框架,以指导模型生成低复杂度代码。另一些工作则利用数据集中的预测熵与香农熵特征,量化模型在代码生成过程中的不确定性,进而设计与测试用例约束相结合的解码策略。此外,数据集所包含的维护性指数已被用于训练代码质量预测模型,为更智能的自动化代码审查工具构建了知识与数据桥梁,推动了软件工程与自然语言处理交叉领域的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务