遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个代码分析数据集,包含164个样本,用于评估代码执行和度量。每个样本包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过/失败数量(tests_passed、tests_failed)、错误类型(error_type)等执行相关字段,以及Halstead复杂度指标(如词汇量、长度、难度、工作量)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc、sloc)、注释百分比(comment_percentage)、类型标记比(TTR)、熵值(shannon_entropy、mean_predictive_entropy、max_predictive_entropy)和函数定义数量(n_func_defined)等代码度量特征。数据集旨在支持代码质量分析、错误检测和软件工程研究,仅包含train分割。

数据集信息: 特征字段: 1. 任务标识符(task_id):数据类型为字符串 2. 入口点(entry_point):数据类型为字符串 3. 可执行性标记(is_executable):数据类型为布尔值 4. 正确性标记(is_correct):数据类型为布尔值 5. 通过测试数(tests_passed):数据类型为64位整数 6. 失败测试数(tests_failed):数据类型为64位整数 7. 测试运行时长(毫秒)(test_run_time_ms):数据类型为空值 8. 错误类型(error_type):数据类型为字符串 9. 哈尔斯特德词汇量(Halstead Vocabulary):数据类型为64位整数 10. 哈尔斯特德长度(Halstead Length):数据类型为64位整数 11. 哈尔斯特德体积(Halstead Volume):数据类型为双精度浮点数 12. 哈尔斯特德难度(Halstead Difficulty):数据类型为双精度浮点数 13. 哈尔斯特德工作量(Halstead Effort):数据类型为双精度浮点数 14. 哈尔斯特德耗时预估(Halstead Time):数据类型为双精度浮点数 15. 圈复杂度(Cyclomatic Complexity):数据类型为64位整数 16. 可维护性指数(Maintainability Index):数据类型为双精度浮点数 17. 代码总行数(loc,Lines of Code):数据类型为64位整数 18. 源代码行数(sloc,Source Lines of Code):数据类型为64位整数 19. 注释占比(comment_percentage):数据类型为双精度浮点数 20. 类型-令牌比(TTR,Type-Token Ratio):数据类型为双精度浮点数 21. 令牌字典(token_dict):数据类型为字符串 22. 香农熵(shannon_entropy,Shannon Entropy):数据类型为双精度浮点数 23. 平均预测熵(mean_predictive_entropy):数据类型为双精度浮点数 24. 最大预测熵(max_predictive_entropy):数据类型为双精度浮点数 25. 已定义函数数量(n_func_defined):数据类型为64位整数 26. 入口点重复标记(entry_point_repeated):数据类型为布尔值 数据划分: - 训练集(train):数据字节数为255473,样本量为164 - 下载大小:112681字节 - 数据集总大小:255473字节 配置信息: - 配置名称:default(默认配置) - 数据文件:针对训练集划分,路径为 `data/train-*`

提供机构:
stefanocarrera
搜集汇总
数据集介绍
构建方式
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run0_metrics,源自对Qwen3-4B模型在特定信任策略下生成的代码执行结果的系统性评估。数据集通过运行一系列编程任务,记录并存储每个任务的执行状态、正确性、测试通过率与失败率、运行耗时等关键指标,同时结合静态代码分析计算Halstead复杂度指标(包括词汇量、长度、难度、工作量等)、循环复杂度、可维护性指数、代码行数(LOC/SLOC)、注释比例、Token多样性(TTR)及熵值等,从而构建出涵盖动态执行与静态结构多维度的代码质量评测集合。数据最终以164条训练样本的规模呈现,适用于小样本分析与模型行为诊断。
特点
本数据集最显著的特点在于融合了代码执行的动态结果与静态复杂度分析,提供了丰富的异构特征。动态维度不仅包含基本的正确性标签与测试用例通过数量,还细致区分了错误类型与执行时间;静态维度则从Halstead系列指标到循环复杂度、可维护性指数、注释比例及Shannon熵,实现对代码结构性、可读性与复杂性的全面量化。此外,Token重复率(TTR)与预测熵的引入,为表征模型生成代码的多样性及不确定性提供了独特视角。这些特点使该数据集成为评估代码生成模型可靠性、分析失败模式与优化策略的理想工具。
使用方法
使用该数据集时,用户可直接加载HuggingFace上的默认配置,通过data_files参数指定train分片文件进行读取。数据集以字典形式提供,每个样本均包含上述全部特征字段,便于直接接入Pandas DataFrame或机器学习流水线。研究人员可基于正确性、测试结果或复杂度指标进行过滤与统计,例如分析模型在何种复杂度区间更易出错,或比较不同误差类型对应的代码结构特征。特别地,entry_point字段可用于追溯具体任务,结合task_id实现跨样本的对比研究。数据集规模较小,适合快速原型验证与归因分析。
背景与挑战
背景概述
该数据集由AutoAutophagy团队与Mercury项目合作构建,旨在评估大语言模型在代码生成任务中的可信度与效能。发布于2024年,基于Qwen3-4B模型在信任策略下的推理结果,数据集聚焦于自动化编程中代码质量与安全性的量化分析。通过整合Halstead复杂度指标、循环复杂度、维护指数及香农熵等元特征,数据集为代码可读性、执行效率与逻辑严谨性提供了多维度的评估基准。其影响力体现在为可信代码生成领域提供标准化的评测体系,推动了生成式模型在软件工程中的应用边界探索。
当前挑战
数据集面临的核心挑战在于:1)所解决的领域问题——代码生成模型的输出可靠性难以保证,传统度量指标如执行正确性(测试通过率)和复杂度参数(如Halstead体积)无法全面反映代码的真实稳健性,需构建综合可信度评估框架;2)构建过程中遇到的困难——数据集仅包含164个训练样本,样本稀疏性导致统计显著性不足,且部分特征如测试运行时间(test_run_time_ms)存在缺失值,影响模型的泛化能力与指标计算的鲁棒性,同时多维度特征的共线性问题增加了数据分析的复杂性。
常用场景
经典使用场景
该数据集为代码生成与自动修复领域的研究提供了精细化的评估基准。其经典使用场景聚焦于测评大型语言模型(如Qwen3-4B)在编程任务上的执行准确性与代码质量,通过记录任务编号、入口函数、测试通过数量、错误类型等关键指标,研究者可系统分析模型生成代码的功能正确性。同时,数据集中包含的Halstead复杂度、圈复杂度、可维护性指数等软件工程度量指标,使得评估维度从单纯的功能正确性延伸至代码的结构优雅性与可维护性,为构建更鲁棒的代码合成系统提供了量化依据。
解决学术问题
该数据集针对性地解决了代码智能领域中‘如何综合评估模型生成代码的多样性能’这一学术难题。传统评估往往仅依赖测试通过率,忽视了代码的复杂性、可读性与内在质量。该数据集引入Halstead系列指标、香农熵与预测熵等表征代码信息复杂度的特征,以及圈复杂度和可维护性指数等传统软件度量,使得研究能够深入探究模型在生成简洁、高效且易于理解的代码上的真实能力。这一多维度的评价体系推动了代码生成研究从‘能运行’向‘高质量’的范式演进,对理解模型内部表征与生成策略具有深远影响。
衍生相关工作
基于该数据集的多维特征体系,已衍生出多项经典研究工作。在代码复杂度预测方向,研究者利用Halstead难度和圈复杂度作为目标变量,构建回归模型来预先评估模型生成代码的维护成本。在鲁棒性分析方面,学者们结合测试通过数与错误类型分布,系统揭示了不同提示策略(如信任度调参t=1.25)对模型输出一致性的影响。此外,关于预测熵的分析催生了生成校准技术的研究,旨在通过不确定性量化来提升代码合成系统的稳健性。这些工作共同拓展了代码智能评估的理论边界,并为下一代交互式编程助手的研发奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务