HydroSEBench Dataset
收藏资源简介:
HydroSEBench是一个专门为水利水电领域设计的专业评估数据集,旨在全面评估模型在水工程专业知识、工程应用和推理计算方面的能力。数据集包含4000个问题,涵盖水利水电的九个核心专业方向,所有问题均为中文,适合评估中文语言模型在水工程领域的专业能力。
HydroSEBench is a specialized evaluation dataset tailored for the water conservancy and hydropower domain, aiming to comprehensively assess the capabilities of models in professional hydraulic engineering knowledge, engineering applications, and inferential computation. The dataset contains 4,000 questions covering nine core professional areas of water conservancy and hydropower. All questions are formulated in Chinese, making it suitable for evaluating the professional competence of Chinese language models in the hydraulic engineering field.
HydroSEBench 数据集概述
数据集简介
HydroSEBench 是一个专为水利水电领域设计的专业评估数据集,旨在全面评估模型在水工专业知识、工程应用和推理计算方面的能力。
数据集规模
- 总题量:4,000 道题目
- 单选题:2,696 道 (67.4%)
- 多选题:1,304 道 (32.6%)
难度分布
- 基础概念知识:1,650 道 (43.75%)
- 工程应用:1,650 道 (43.75%)
- 推理与计算:700 道 (12.5%)
专业方向类别分布
数据集涵盖九个核心专业方向,具体分布如下:
| 类别代码 | 类别名称 | 总题量 | 单选题 | 多选题 | 基础概念知识 | 工程应用 | 推理与计算 |
|---|---|---|---|---|---|---|---|
| BK | 背景知识 | 250 | 217 | 33 | 250 | 0 | 0 |
| IS | 行业标准 | 250 | 160 | 90 | 0 | 250 | 0 |
| HWR | 水文与水资源 | 500 | 311 | 189 | 200 | 200 | 100 |
| GE | 岩土工程 | 500 | 297 | 203 | 200 | 200 | 100 |
| HSE | 水工结构与设备 | 500 | 336 | 164 | 200 | 200 | 100 |
| ESM | 工程安全与管理 | 500 | 318 | 182 | 200 | 200 | 100 |
| HRD | 水力学与河流动力学 | 500 | 358 | 142 | 200 | 200 | 100 |
| M | 气象学 | 500 | 336 | 164 | 200 | 200 | 100 |
| PS | 电力系统 | 500 | 363 | 137 | 200 | 200 | 100 |
数据集特点
- 覆盖全面:涵盖水利水电工程从基础概念到工程实践的核心知识领域。
- 难度分级:平衡基础知识和高级推理,以全面评估模型能力。
- 题型多样:包含单选题和多选题,更贴近实际应用场景。
- 中文语境:所有题目均为中文,针对中文语言模型和水工领域知识进行了优化。
- 专业质量:题目经过水工专家多轮审核,确保专业性和准确性。
数据获取与格式
- 文件位置:数据集文件位于
hydrosebench-eval/hydrosebench/data/目录。 - 可用格式:
- hydrosebench.json:完整的 JSON 格式数据集。
- hydrosebench.csv:CSV 格式数据集(更轻量,适合版本控制)。
- 数据字段:
- ID:唯一问题标识符(例如 "BK-1", "HWR-1")。
- Question:问题内容(包含选项)。
- Answer:正确答案(例如 "C" 或 "A,B")。
- Category:类别代码(BK, IS, HWR, GE, HSE, ESM, HRD, M, PS)。
- Level:难度等级(基础概念知识,工程应用,推理与计算)。
- Type:问题类型(单选题,多选题)。
评估工具
提供专用的 Python 包用于评估模型在 HydroSEBench 数据集上的性能,支持功能包括:
- 批量评估多个模型。
- 自动生成详细的评估报告(Excel, JSON, Markdown)。
- 按类别、难度和题型进行统计分析。
- 支持自定义基准测试。
- 灵活的答案格式支持。
项目结构
hydrosebench-package/ ├── hydrosebench-eval/ # HydroSEBench 评估工具包 │ ├── hydrosebench/ # 核心模块 │ │ └── data/ # 内置数据集 │ │ ├── hydrosebench.json │ │ └── hydrosebench.csv │ └── README.md # 完整的评估工具文档 ├── examples/ # 使用示例代码 │ ├── example_0_download_data.py │ ├── example_1_basic_evaluation.py │ └── ... └── README.md # 本文件(数据集介绍)
许可证
本项目采用 MIT 许可证。




