UnitSafe
收藏资源简介:
UnitSafe是一个用于评估AI模型在计量推理方面能力的基准数据集,特别关注维度正确计算和区分物理上不同但具有相同SI维度的量。该数据集包含500个问题,涵盖13个科学领域,包括热力学、辐射物理、药代动力学、电气工程等。数据集分为376个转换问题和124个必须失败问题,旨在测试模型的三个关键能力:维度计算、维度安全和KOQ区分。每个问题以JSON格式存储,包含问题ID、问题文本、答案、量种类、SI签名、难度等级等字段。数据集还包含10个KOQ退化簇,用于测试模型在区分物理上不同但维度相同的量方面的能力。UnitSafe适用于评估LLM和AI系统在需要精确单位转换和维度安全的实际应用中的表现,如临床、制药、航空航天和工程等领域。
UnitSafe is a benchmark dataset designed to evaluate the capabilities of AI models in dimensional reasoning, with a particular focus on correct dimensional calculations and distinguishing between physically different quantities that share the same SI dimensions. The dataset comprises 500 questions spanning 13 scientific domains, including thermodynamics, radiation physics, pharmacokinetics, electrical engineering, and more. It is divided into 376 conversion problems and 124 must-fail problems, targeting three key capabilities of models: dimensional calculation, dimensional safety, and KOQ discrimination. Each question is stored in JSON format and includes fields such as question ID, question text, answer, quantity kind, SI signature, and difficulty level. The dataset also contains 10 KOQ degenerate clusters to test the models ability to distinguish between physically different but dimensionally identical quantities. UnitSafe is suitable for evaluating the performance of LLMs and AI systems in real-world applications requiring precise unit conversion and dimensional safety, such as clinical, pharmaceutical, aerospace, and engineering fields.
UnitSafe:计量推理基准数据集
数据集概述
UnitSafe 是一个用于评估 AI 模型 计量推理能力 的基准数据集,由 500 个问题组成,旨在测试模型是否能进行量纲正确的计算,并区分具有相同 SI 量纲但物理意义不同的物理量(即 物理量种类(KOQ)辨别 能力)。
核心能力测试
- 量纲运算:正确进行跨系统(SI、CGS、英制、临床单位)的多步单位转换。
- 量纲安全:在量纲不兼容时拒绝生成数值答案。
- KOQ 辨别:识别量纲相同但物理本质不同的物理量(如扭矩≠能量、吸收剂量≠等效剂量),并在缺乏必要桥梁信息时拒绝转换。
数据集统计
| 统计项 | 数值 |
|---|---|
| 问题总数 | 500 |
| 转换问题 | 376 |
| 必须拒绝问题 | 124 |
| 科学领域 | 13 |
| KOQ 简并簇 | 10 |
| 唯一 SI 量纲签名 | 62 |
| 唯一物理量种类 | 102 |
| 难度等级 | 4 |
领域分布
| 领域 | 问题数 | 描述 |
|---|---|---|
| 热力学 | 57 | 熵、焓、吉布斯自由能、热容 |
| 辐射物理 | 45 | 吸收剂量、等效剂量、活度、kerma、质子 RBE |
| 药物动力学 | 43 | 清除率、AUC、Vd、生物利用度、剂量计算 |
| 电气工程 | 42 | 功率三角形(VA/W/var)、磁学、电路、谐振 |
| 跨领域安全 | 41 | 混合领域量纲不匹配和 KOQ 陷阱 |
| 力学/结构 | 41 | 扭矩 vs 能量、应力 vs 压强 vs 能量密度 |
| 流体动力学 | 39 | 粘度、雷诺数、水头损失、流量转换 |
| 地球物理/大气科学 | 37 | 压强体系、辐射强迫、风速、海拔 |
| 生物化学/临床 | 36 | 浓度单位、酶活性(katal vs IU)、pH、渗透压 |
| 光度学/辐射度量学 | 33 | 光通量 vs 辐射通量、辐照度、维恩定律、光子能量 |
| 护理/医学 | 32 | 静脉滴注速率、按体重给药、血管升压药物计算 |
| 化学工程 | 31 | 传热、粘度、反应动力学、阿伦尼乌斯方程 |
| 天文学 | 23 | 秒差距/光年/AU、星等系统、开普勒定律、史瓦西半径 |
KOQ 简并簇
| 簇名称 | SI 量纲签名 | 简并物理量种类 | 问题数 |
|---|---|---|---|
| cluster_3_kJmol | M·L²·T⁻²·N⁻¹ | 摩尔焓、吉布斯自由能、化学势 | 36 |
| cluster_7 | M·L⁻¹·T⁻² | 压强、应力、能量密度 | 33 |
| cluster_4_Jkg | L²·T⁻² | 吸收剂量(Gy)、等效剂量(Sv)、kerma | 24 |
| cluster_6_VA_W_var | M·L²·T⁻³ | 有功功率(W)、视在功率(VA)、无功功率(var) | 14 |
| cluster_5_Nm | M·L²·T⁻² | 扭矩、能量、功 | 12 |
| cluster_2_JKmol | M·L²·T⁻²·Θ⁻¹·N⁻¹ | 摩尔熵、摩尔热容 | 12 |
| cluster_1_JK | M·L²·T⁻²·Θ⁻¹ | 熵、热容 | 11 |
| cluster_9 | 变化 | 光通量(lm)vs 辐射通量(W) | 8 |
| cluster_10 | 无量纲 | 视星等 vs 绝对星等 vs 热星等 | 5 |
| cluster_8_invS | T⁻¹ | 放射性活度(Bq)vs 频率(Hz) | 3 |
难度等级
| 等级 | 描述 | 问题数 |
|---|---|---|
| tier_1 | 单步单位转换 | 163 |
| tier_2 | 多步转换或需 KOQ 意识 | 204 |
| tier_3 | 多步骤结合领域知识(如 RBE、功率因数) | 107 |
| tier_4 | 物理推理、代数结构或约束满足 | 26 |
问题类型
| 类型 | 数量 | 描述 |
|---|---|---|
| 转换问题 | 376 | 生成带单位的正确数值答案 |
| 必须拒绝(量纲) | 62 | 拒绝:量纲不兼容 |
| 必须拒绝(KOQ) | 62 | 拒绝:量纲匹配但物理量种类不同 |
数据模式
每个问题为 JSON 对象,包含以下字段:
problem_id:问题唯一标识符problem_text:问题文本描述answer:答案对象,包含value(数值,float64)、unit(单位,字符串)、tolerance_pct(容差百分比,float64)quantity_kind:物理量种类对象,包含key(键值,字符串)和category(类别,字符串)si_signature:SI 基量纲指数签名(字符串)koq_cluster:KOQ 简并簇名称(字符串)koq_confuser:模型可能错误分配的物理量种类名称(字符串)difficulty:难度等级(字符串)must_fail:布尔值,表示该问题是否必须拒绝回答expected_error:对于必须拒绝的问题,指定错误类型(dimension_mismatch、koq_mismatch或insufficient_context)source:来源对象,包含dataset(数据集名称,字符串)和origin(起源领域,字符串)tags:标签列表(字符串序列)
评估指标
- 整体准确率:所有 500 个问题的正确率
- 转换准确率:376 个转换问题的正确率
- 拒绝准确率:124 个必须拒绝问题的正确拒绝率
- KOQ 辨别得分:62 个 KOQ 必须拒绝问题中正确识别为 KOQ 不匹配的比例
- 每簇 KOQ 得分:每个 KOQ 简并簇内的准确率
- 每领域准确率:按科学领域划分的性能
- 每等级准确率:按难度等级划分的性能
预期用途
- AI 实验室模型评估
- 受监管行业采购评估
- 工具增强型 AI 评估
- 教育研究
限制
- 转换问题的答案基于计算值,容差窗口可能无法涵盖多步问题的所有有效解法
- 基准测试测试的是 KOQ 区分的 识别 能力,而非 解决 能力
- 领域覆盖广泛但并非详尽无遗
- 必须拒绝问题采用保守的安全立场,某些上下文下领域专家可能认为某些标记的转换在有适当说明时可接受
许可协议
Apache-2.0




