autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.2_g3_metrics
收藏资源简介:
该数据集包含164个训练样本,总大小为219442字节。数据集提供了多个特征字段,包括任务ID(task_id)、入口点(entry_point)、是否可执行(is_executable)、是否正确(is_correct)、通过和失败的测试数量(tests_passed, tests_failed)、测试运行时间(test_run_time_ms)、错误类型(error_type)、以及一系列代码复杂度度量指标如Halstead度量(halstead_vocabulary, halstead_length, halstead_volume, halstead_difficulty, halstead_effort, halstead_time)、维护性指数(maintainability_index)、TTR(token type ratio)、token字典(token_dict)、定义的函数数量(n_func_defined)和入口点是否重复(entry_point_repeated)。数据集适用于代码质量分析、自动化测试和软件维护性评估等任务。
本数据集共包含164条训练样本,总容量为219442字节。数据集提供了多种特征字段,包括任务ID(task_id)、入口点(entry_point)、可执行性标识(is_executable)、正确性标识(is_correct)、测试通过与失败数量(tests_passed、tests_failed)、测试运行时长(test_run_time_ms)、错误类型(error_type),以及一系列代码复杂度度量指标:哈尔斯特德词汇量(halstead_vocabulary)、哈尔斯特德长度(halstead_length)、哈尔斯特德体积(halstead_volume)、哈尔斯特德难度(halstead_difficulty)、哈尔斯特德工作量(halstead_effort)、哈尔斯特德耗时(halstead_time)、维护性指数(maintainability_index)、令牌类型比率(TTR,token type ratio)、令牌词典(token_dict)、已定义函数数量(n_func_defined)以及入口点重复标识(entry_point_repeated)。本数据集适用于代码质量分析、自动化测试及软件维护性评估等相关任务。
数据集概述
数据集基本信息
- 数据集名称: autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.2_g3_metrics
- 来源地址: https://huggingface.co/datasets/stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.2_g3_metrics
- 数据量: 164 个示例
- 数据集大小: 219,442 字节
- 下载大小: 89,265 字节
- 数据格式: 包含一个训练集(train)拆分
数据结构与特征
数据集包含以下字段:
标识与执行信息
task_id: 任务标识符(字符串类型)entry_point: 入口点(字符串类型)is_executable: 是否可执行(布尔类型)is_correct: 是否正确(布尔类型)tests_passed: 通过的测试数量(整数类型)tests_failed: 失败的测试数量(整数类型)test_run_time_ms: 测试运行时间(毫秒,当前为空值类型)error_type: 错误类型(字符串类型)
代码度量指标
halstead_vocabulary: Halstead 词汇量(整数类型)halstead_length: Halstead 长度(整数类型)halstead_volume: Halstead 体积(浮点数类型)halstead_difficulty: Halstead 难度(浮点数类型)halstead_effort: Halstead 工作量(浮点数类型)halstead_time: Halstead 时间(浮点数类型)maintainability_index: 可维护性指数(浮点数类型)TTR: 类型标记比(浮点数类型)token_dict: 令牌字典(字符串类型)n_func_defined: 定义的函数数量(整数类型)entry_point_repeated: 入口点是否重复(布尔类型)
数据文件
- 配置文件: default
- 数据文件路径:
data/train-*




