遇见数据集

HORB: Healthcare Operational Reasoning Benchmark Suite

收藏
github2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

HORB是一个原创的医疗AI基准套件,旨在评估现实医疗工作流程中的操作推理能力。它专注于测试AI系统在复杂多文档医疗场景中区分表面操作准备与实际可执行准备的能力,包含12个基准测试、336个虚构医疗操作源文档,覆盖住院、门诊、手术室、行为健康等多个领域。该数据集仅使用虚构材料,不包含真实患者信息。

HORB is an original medical AI benchmark suite developed to evaluate operational reasoning abilities in real-world medical workflows. It specifically tests the capacity of AI systems to differentiate between superficial operational preparations and truly executable preparation steps within complex multi-document medical scenarios. The suite includes 12 benchmark tests and 336 fictional source documents detailing medical procedures, covering multiple domains such as inpatient care, outpatient services, operating rooms, and behavioral health. This dataset solely utilizes fictional materials and does not contain any real patient information.

创建时间:
2026-07-08
原始信息汇总

数据集概述:HORB(Healthcare Operational Reasoning Benchmark Suite)

HORB 是一个原创的医疗人工智能基准测试套件,版本 1.0,由注册护士 Meredith Reese 创建,用于评估 AI 系统在真实医疗工作流程中的操作推理能力。

核心评估目标

  • 中心问题:AI 能否在现实医疗约束下,区分“表面操作就绪”与“实际可执行就绪”,并做出操作合理的决策?
  • 评估重点并非医学知识本身,而是在复杂医疗环境中的操作判断能力。

数据集构成

  • 基准数量:包含 12 个原创医疗操作推理基准测试。
  • 源文档:共生成 336 份虚构的医疗操作源文档。
  • 配套资源:包含系统指令、任务提示、设计简介和评分标准。
  • 数据包:提供可下载的压缩包 HORB_v1_0_12_Benchmark_Package.zip,内含所有 12 个基准文件夹。

基准测试领域(12 个)

每个基准测试均针对特定医疗领域和操作流程:

基准编号 领域 操作焦点
HORB-001 产房与分娩操作 产房值班护士 / 产科分诊流程
HORB-002 消毒供应与围手术期操作 消毒供应 / 手术室病例推车准备流程
HORB-003 家庭健康操作 家庭健康访视协调 / 实地护理路线
HORB-004 门诊输液与肿瘤操作 门诊输液中心 / 肿瘤治疗准备
HORB-005 临终关怀操作 临终关怀值班 / 症状危机与访视路线
HORB-006 急诊科操作 急诊科分诊 / 房间分配与救护车卸载流程
HORB-007 围手术期操作 围手术期加台手术 / 周转流程
HORB-008 行为健康操作 行为健康危机单元 / 精神科收治与安全安置
HORB-009 医院药房与护理过渡 医院药房 / 药物重整与出院准备
HORB-010 病例管理与出院计划 医院病例管理 / 出院安置与床流
HORB-011 围手术期入院前检查 围手术期入院前检查 / 手术当日通行许可
HORB-012 初级保健操作 初级保健当日分诊 / 日程安排流程

评估的核心能力

  • 多文档推理
  • 操作优先级排序
  • 时间推理
  • 工作流协调
  • 资源分配
  • 职责边界识别
  • 来源溯源
  • 不确定性管理

设计旨在发现的常见失败模式

  • 将表面就绪视为实际就绪
  • 做出过早的操作承诺
  • 忽略未解决的依赖关系
  • 违反角色或所有权边界
  • 依赖过时或复制而来的信息
  • 错过时间敏感的安全信号
  • 生成看似合理但缺乏依据的计划

数据集的预期用途

  • 医疗 AI 评估
  • 大型语言模型基准设计
  • 临床工作流推理审查
  • AI 响应评分与评分标准设计
  • 医疗操作模拟
  • 临床文档与操作质量保证组合工作
  • 在 AI 评估角色中展示医疗领域专业知识

重要声明与限制

  • 所有基准材料均为虚构,用于评估和作品集展示目的。
  • 不包含任何真实患者信息、健康记录或医疗机构数据。
  • 该基准套件并非临床决策支持、医疗建议、患者护理指导,也不能替代机构政策、临床判断或持证医疗实践。

作者信息

  • 创建者:Meredith Reese(注册护士)
  • 该套件体现了临床护理经验在医疗 AI 评估、来源依据推理、工作流分析及基于评分标准的模型审查中的应用。
搜集汇总
数据集介绍
构建方式
HORB(医疗运营推理基准套件)由资深注册护士Meredith Reese基于临床护理经验独立构建,专注于评估人工智能在复杂医疗场景中的运营推理能力。该数据集包含12个原创基准测试,覆盖住院、门诊、围手术期、家庭健康、行为健康、药房及个案管理等多个医疗领域。每个基准测试均提供详细的设计摘要、系统提示、严格评分准则及虚构的运营源文档,共计336份文档。所有材料均为虚构,不涉及任何真实患者信息或机构数据,确保隐私合规与安全评估。
特点
HORB的核心特点在于其评估的深度与真实性,它不仅仅考察医疗知识检索,而是聚焦于AI系统在不确定性下能否区分“表面运营就绪”与“实际可执行就绪”。数据集着重检验多文档推理、优先级排序、时间约束识别、工作流协调、资源配置、角色权限边界及不确定性管理等高阶能力。通过设计常见失败模式(如过早承诺、忽略未解决依赖、依赖过时信息等),HORB揭示了AI在真实医疗运营决策中的脆弱性,强调“可执行推理”而非盲目自信。
使用方法
使用者可直接从GitHub仓库下载HORB_v1_0_12_Benchmark_Package.zip压缩包,其中包含12个独立基准测试文件夹。每个文件夹均以标准化结构组织,包括设计摘要、系统提示、评分指南及虚构源文档。研究者可按需加载单个场景,将系统提示与任务指令输入待评估的AI模型,根据严格评分准则对其输出进行打分。该套件适用于医疗AI评测、LLM基准设计、临床工作流推理审查及运营文档质量评估,亦可作为展示医疗领域AI评估专业能力的作品集素材。
背景与挑战
背景概述
HORB(Healthcare Operational Reasoning Benchmark Suite)是由注册护士Meredith Reese于2024年创建的首个专注于医疗运营推理的AI基准测试套件。该数据集旨在评估AI系统在复杂、多文档的医疗场景中,区分“表面运营就绪”与“实际可执行就绪”的能力。它涵盖了12个原创基准测试,涉及住院、门诊、围手术期、家庭健康、临终关怀等跨领域医疗工作流程,共包含336份虚构的医疗运营源文档。HORB的提出填补了现有医疗AI评估中过度聚焦医学知识而忽视运营判断能力的空白,推动了AI在真实医疗环境中安全、有效决策的发展。
当前挑战
HORB所解决的领域问题核心在于:现有AI系统常将医疗场景中的表面信息(如文档齐全)误判为实际执行的能力,忽略工作流依赖、资源限制、时间约束等深层运营因素。这导致AI在复杂多文档推理中频繁出现优先级混乱、依赖未解决、角色越界、信息陈旧等失败模式。构建过程中,挑战包括设计具有现实复杂度的运营场景(如跨部门协作、时间敏感性决策)、确保源文档的连贯性与冲突性、制定严格且可复用的评分标准以评估运营推理质量。此外,需排除真实患者数据以确保隐私合规,同时维持场景的真实性与教学价值,这对数据合成与领域知识融合提出了高要求。
常用场景
经典使用场景
在医疗人工智能的评估领域中,HORB基准套件被广泛用于检验大型语言模型在复杂、多文档医疗工作流程中的操作推理能力。其经典使用场景涉及模拟真实的医疗运营环境,例如产房分诊、无菌处理与围手术期准备、家庭健康访视协调以及临终关怀应急响应等12个领域。通过向模型提供虚构的源文档集合,HORB要求模型区分表面上的操作就绪状态与实际可执行的就绪状态,从而评判其在优先排序、时间约束、资源分配和所有权边界等维度上的推理质量。这一场景尤其适用于评估AI在不确定条件下做出安全、可执行的运营决策的能力。
实际应用
在现实世界中,HORB基准套件可被部署用于医疗AI系统的上岗前验证与持续质量监测。医疗机构或AI开发团队可利用其虚构但高度逼真的场景,对智能分诊助手、手术排程协调系统、病例管理决策支持工具等进行操作逻辑的鲁棒性测试。例如,在电子健康记录集成环境中,HORB能够检验AI是否能在考虑床位可用性、人员排班、设备消毒状态及跨科室交接流程后,给出恰当的患者转归建议。此外,该套件还可用于临床文档审核系统,帮助识别护理记录中可能存在的逻辑断裂或信息滞后,从而提升医疗运营的安全性与效率。
衍生相关工作
自HORB发布以来,其设计理念与评估框架已催生了一系列衍生研究。在学术层面,研究者借鉴其基于多源文档的操作推理评估思路,构建了用于急诊医学、重症监护和基层医疗等细分领域的定制化基准。部分工作专注于将HORB的失败模式分类法应用于模型微调,通过引入对‘实际可执行性’的显式惩罚来训练更审慎的医疗AI。此外,HORB的评分细则与系统提示设计模式也被采纳为医疗AI评估的标准模板,启发了类似财务合规审核、法律流程推理等跨领域操作推理基准的构建。这些衍生工作共同拓展了操作推理评估的边界,使其从医疗领域辐射至更广泛的复杂系统决策场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务