stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g1_run0_metrics
收藏资源简介:
该数据集是一个代码分析数据集,包含164个样本,用于评估代码执行和度量。每个样本包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过/失败数量(tests_passed、tests_failed)、错误类型(error_type)等执行相关字段,以及Halstead复杂度指标(如词汇量、长度、难度、工作量)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc、sloc)、注释百分比(comment_percentage)、类型标记比(TTR)、熵值(shannon_entropy、mean_predictive_entropy、max_predictive_entropy)和函数定义数量(n_func_defined)等代码度量特征。数据集旨在支持代码质量分析、错误检测和软件工程研究,仅包含train分割。
数据集信息: 特征字段: 1. 任务标识符(task_id):数据类型为字符串 2. 入口点(entry_point):数据类型为字符串 3. 可执行性标记(is_executable):数据类型为布尔值 4. 正确性标记(is_correct):数据类型为布尔值 5. 通过测试数(tests_passed):数据类型为64位整数 6. 失败测试数(tests_failed):数据类型为64位整数 7. 测试运行时长(毫秒)(test_run_time_ms):数据类型为空值 8. 错误类型(error_type):数据类型为字符串 9. 哈尔斯特德词汇量(Halstead Vocabulary):数据类型为64位整数 10. 哈尔斯特德长度(Halstead Length):数据类型为64位整数 11. 哈尔斯特德体积(Halstead Volume):数据类型为双精度浮点数 12. 哈尔斯特德难度(Halstead Difficulty):数据类型为双精度浮点数 13. 哈尔斯特德工作量(Halstead Effort):数据类型为双精度浮点数 14. 哈尔斯特德耗时预估(Halstead Time):数据类型为双精度浮点数 15. 圈复杂度(Cyclomatic Complexity):数据类型为64位整数 16. 可维护性指数(Maintainability Index):数据类型为双精度浮点数 17. 代码总行数(loc,Lines of Code):数据类型为64位整数 18. 源代码行数(sloc,Source Lines of Code):数据类型为64位整数 19. 注释占比(comment_percentage):数据类型为双精度浮点数 20. 类型-令牌比(TTR,Type-Token Ratio):数据类型为双精度浮点数 21. 令牌字典(token_dict):数据类型为字符串 22. 香农熵(shannon_entropy,Shannon Entropy):数据类型为双精度浮点数 23. 平均预测熵(mean_predictive_entropy):数据类型为双精度浮点数 24. 最大预测熵(max_predictive_entropy):数据类型为双精度浮点数 25. 已定义函数数量(n_func_defined):数据类型为64位整数 26. 入口点重复标记(entry_point_repeated):数据类型为布尔值 数据划分: - 训练集(train):数据字节数为255473,样本量为164 - 下载大小:112681字节 - 数据集总大小:255473字节 配置信息: - 配置名称:default(默认配置) - 数据文件:针对训练集划分,路径为 `data/train-*`



