HORB: Healthcare Operational Reasoning Benchmark Suite
收藏资源简介:
HORB是一个原创的医疗AI基准套件,旨在评估现实医疗工作流中的操作推理。它评估AI系统在涉及优先级、工作流依赖、所有权边界、时间约束、文档质量、人员限制和资源可用性的现实医疗操作中是否能够进行推理。该套件包含12个医疗操作推理基准,覆盖住院、门诊、围手术期、行为健康、药房和病例管理等多个领域,使用虚构材料,不包含真实患者数据。
HORB is an original medical AI benchmark suite designed to evaluate operational reasoning in real-world clinical workflows. It assesses whether AI systems can perform reasoning across realistic clinical operations involving priorities, workflow dependencies, ownership boundaries, temporal constraints, documentation quality, staffing limitations, and resource availability. This suite includes 12 clinical operational reasoning benchmarks, covering multiple domains such as inpatient care, outpatient care, perioperative care, behavioral health, pharmacy, and case management. All materials used are fictional and contain no real patient data.
数据集概述:HORB (Healthcare Operational Reasoning Benchmark Suite)
- 版本: 1.0
- 作者: Meredith Reese, RN
- 状态: 初始公开作品集发布
- 核心评估问题: AI 系统能否在现实的医疗约束下,区分表面的操作就绪状态与实际的可执行就绪状态,并做出合理的操作决策。
项目聚焦
HORB 是一个原创的医疗 AI 基准测试套件,旨在评估 AI 系统在复杂的多文档医疗场景中进行操作推理的能力。其重点不在于评估医学知识,而在于评估 AI 在优先级排序、工作流依赖、权限边界、时间约束、文档质量、人员配置和资源可用性等方面的操作判断能力。
基准测试内容
- 基准测试数量: 12 个原创医疗操作推理基准测试
- 源文档数量: 336 份虚构的医疗操作源文档
- 覆盖领域: 涵盖住院、门诊、围手术期、急性后期、行为健康、药房和病例管理等医疗工作流。
12 个基准测试领域详情
| 基准测试 | 领域 | 操作重点 |
|---|---|---|
| HORB-001 | 产科运营 | 产房护士长 / 产科分诊流程 |
| HORB-002 | 消毒供应与围手术期运营 | 消毒供应 / 手术室手术车就绪流程 |
| HORB-003 | 家庭健康运营 | 家庭健康探视协调 / 实地护理路线 |
| HORB-004 | 门诊输液与肿瘤运营 | 门诊输液中心 / 肿瘤治疗就绪 |
| HORB-005 | 临终关怀运营 | 临终关怀值班 / 症状危机与访视路线 |
| HORB-006 | 急诊运营 | 急诊分诊 / 房间分配与救护车下客流程 |
| HORB-007 | 围手术期运营 | 围手术期加台 / 周转流程 |
| HORB-008 | 行为健康运营 | 行为健康危机单元 / 精神科入院与安全安置 |
| HORB-009 | 医院药房与护理过渡 | 医院药房 / 药物核对与出院就绪 |
| HORB-010 | 病例管理与出院计划 | 医院病例管理 / 出院安置与患者周转 |
| HORB-011 | 围手术期入院前检查 | 围手术期入院前检查 / 手术当日许可 |
| HORB-012 | 初级保健运营 | 初级保健当日分诊 / 日程路由流程 |
评估的核心能力
- 多文档推理
- 操作优先级排序
- 时间推理
- 工作流协调
- 资源分配
- 权限边界识别
- 来源溯源
- 不确定性管理
设计用于揭示的常见故障模式
- 将表面就绪视为实际就绪
- 做出过早的操作承诺
- 忽略未解决的依赖关系
- 违反角色或权限边界
- 依赖过时或复制的信息
- 错过时间敏感的安全信号
- 生成表面完美但缺乏依据的计划
设计理念
医疗操作既奖励果断行动,也奖励适当的克制。一个高质量的操作计划不仅仅是识别接下来可能发生什么,而是根据已确认的信息、可用资源、实际工作流和适当权限,识别接下来实际可以发生什么。
预期用途
- 医疗 AI 评估
- 大型语言模型(LLM)基准测试设计
- 临床工作流推理审查
- AI 响应评分与评分标准设计
- 医疗操作模拟
- 临床文档与操作质量控制作品集工作
- 在 AI 评估岗位中展示医疗领域专业知识
包含的文件与内容
存储库包含公开作品集版本 HORB v1.0,主要文件包括:
Executive_Summary.md、Project_Summary.md、Methodology.md、Benchmark_Overview.mdCommon_Failure_Modes.md、Scope_and_Limitations.md、Design_Philosophy.md、Why_Nursing_Matters.mdCITATION.md、LICENSE.md、FILE_INDEX.mdHORB_v1_0_12_Benchmark_Package.zip:可下载的压缩包,包含全部 12 个基准测试场景。
每个基准测试文件夹内包含:
00_Design_Brief.md、UseCase_System_Prompt.md、Strict_Grading_Guidelines.mdsource_docs/目录(虚构操作源文档)SourceDocs.zip(归档源文档包)Source_Documents_Manifest.mdoriginal_batches/目录(如有)
范围与免责声明
所有基准测试材料均为虚构,仅用于评估和作品集目的。不包含任何真实患者信息、健康记录或医疗机构数据。HORB 不是临床决策支持、医疗建议、患者护理指导,也不能替代机构政策、临床医生判断或持证医疗实践。



