HORB: Healthcare Operational Reasoning Benchmark Suite
收藏资源简介:
HORB是一个原创的医疗AI基准套件,旨在评估现实医疗工作流程中的操作推理能力。它专注于测试AI系统在复杂多文档医疗场景中区分表面操作准备与实际可执行准备的能力,包含12个基准测试、336个虚构医疗操作源文档,覆盖住院、门诊、手术室、行为健康等多个领域。该数据集仅使用虚构材料,不包含真实患者信息。
HORB is an original medical AI benchmark suite developed to evaluate operational reasoning abilities in real-world medical workflows. It specifically tests the capacity of AI systems to differentiate between superficial operational preparations and truly executable preparation steps within complex multi-document medical scenarios. The suite includes 12 benchmark tests and 336 fictional source documents detailing medical procedures, covering multiple domains such as inpatient care, outpatient services, operating rooms, and behavioral health. This dataset solely utilizes fictional materials and does not contain any real patient information.
数据集概述:HORB(Healthcare Operational Reasoning Benchmark Suite)
HORB 是一个原创的医疗人工智能基准测试套件,版本 1.0,由注册护士 Meredith Reese 创建,用于评估 AI 系统在真实医疗工作流程中的操作推理能力。
核心评估目标
- 中心问题:AI 能否在现实医疗约束下,区分“表面操作就绪”与“实际可执行就绪”,并做出操作合理的决策?
- 评估重点并非医学知识本身,而是在复杂医疗环境中的操作判断能力。
数据集构成
- 基准数量:包含 12 个原创医疗操作推理基准测试。
- 源文档:共生成 336 份虚构的医疗操作源文档。
- 配套资源:包含系统指令、任务提示、设计简介和评分标准。
- 数据包:提供可下载的压缩包
HORB_v1_0_12_Benchmark_Package.zip,内含所有 12 个基准文件夹。
基准测试领域(12 个)
每个基准测试均针对特定医疗领域和操作流程:
| 基准编号 | 领域 | 操作焦点 |
|---|---|---|
| HORB-001 | 产房与分娩操作 | 产房值班护士 / 产科分诊流程 |
| HORB-002 | 消毒供应与围手术期操作 | 消毒供应 / 手术室病例推车准备流程 |
| HORB-003 | 家庭健康操作 | 家庭健康访视协调 / 实地护理路线 |
| HORB-004 | 门诊输液与肿瘤操作 | 门诊输液中心 / 肿瘤治疗准备 |
| HORB-005 | 临终关怀操作 | 临终关怀值班 / 症状危机与访视路线 |
| HORB-006 | 急诊科操作 | 急诊科分诊 / 房间分配与救护车卸载流程 |
| HORB-007 | 围手术期操作 | 围手术期加台手术 / 周转流程 |
| HORB-008 | 行为健康操作 | 行为健康危机单元 / 精神科收治与安全安置 |
| HORB-009 | 医院药房与护理过渡 | 医院药房 / 药物重整与出院准备 |
| HORB-010 | 病例管理与出院计划 | 医院病例管理 / 出院安置与床流 |
| HORB-011 | 围手术期入院前检查 | 围手术期入院前检查 / 手术当日通行许可 |
| HORB-012 | 初级保健操作 | 初级保健当日分诊 / 日程安排流程 |
评估的核心能力
- 多文档推理
- 操作优先级排序
- 时间推理
- 工作流协调
- 资源分配
- 职责边界识别
- 来源溯源
- 不确定性管理
设计旨在发现的常见失败模式
- 将表面就绪视为实际就绪
- 做出过早的操作承诺
- 忽略未解决的依赖关系
- 违反角色或所有权边界
- 依赖过时或复制而来的信息
- 错过时间敏感的安全信号
- 生成看似合理但缺乏依据的计划
数据集的预期用途
- 医疗 AI 评估
- 大型语言模型基准设计
- 临床工作流推理审查
- AI 响应评分与评分标准设计
- 医疗操作模拟
- 临床文档与操作质量保证组合工作
- 在 AI 评估角色中展示医疗领域专业知识
重要声明与限制
- 所有基准材料均为虚构,用于评估和作品集展示目的。
- 不包含任何真实患者信息、健康记录或医疗机构数据。
- 该基准套件并非临床决策支持、医疗建议、患者护理指导,也不能替代机构政策、临床判断或持证医疗实践。
作者信息
- 创建者:Meredith Reese(注册护士)
- 该套件体现了临床护理经验在医疗 AI 评估、来源依据推理、工作流分析及基于评分标准的模型审查中的应用。




