遇见数据集

CentificAIResearch/CareTransition-Audit

收藏
Hugging Face2026-06-22 更新2026-07-22 收录
官方服务:

资源简介:

CareTransition-Audit将DISCHARGED助记符(Ng等人,2025年)操作化为一个包含46个原子审计问题的清单,涵盖10个组件:人口统计、重要警报、社会设置、全面病史、病史和检查、评估和临床过程、记录的药物变更、护理目标、预期随访和出院信息(附加)。每个(摘要,问题)对被标注为四个标签之一——是、否、不明确、不适用——并附带逐字证据和简要理由。该基准旨在评估大型语言模型作为出院文档完整性的自动化审计员,而不是临床护理质量的评分者。框架区分“完整性≠质量”是核心:一份摘要可能满足每个清单项目,但仍然组织混乱或临床不一致。

CareTransition-Audit operationalizes the DISCHARGED mnemonic (Ng et al., 2025) into a checklist of 46 atomic audit questions across 10 components: Demographics, Important alerts, Social setup, Comprehensive history, History & examinations, Assessment & clinical course, Recorded medication changes, Goals of care, Expected follow-up, and Discharge information (Additional). Each (summary, question) pair is annotated with one of four labels — Yes, No, Unclear, N/A — together with verbatim evidence and a brief justification. The benchmark is designed for evaluating large language models (LLMs) as automated auditors of discharge documentation completeness, not as graders of clinical care quality. The framing distinction completeness ≠ quality is central: a summary may satisfy every checklist item yet still be poorly organized or clinically inconsistent.

提供机构:
CentificAIResearch
搜集汇总
数据集介绍
CentificAIResearch/CareTransition-Audit 数据集图片
构建方式
CareTransition-Audit数据集源自MIMIC-IV数据库,聚焦于成年住院患者的出院小结。研究者通过分层抽样方法,依据出院去向与ICU使用情况两个临床专家认可的维度,从50份独特的患者小结中构建样本。标注过程由临床专家针对一份包含46个原子化审计问题的清单(源自DISCHARGED记忆法)逐一进行,每个(小结,问题)配对被赋予“是”、“否”、“不明确”或“不适用”四种标签之一,并附有原文证据与简要理由。初始的34题版本在试点标注中发现复合项存在歧义后,被细化为46个原子问题,同时排除了格式相关的条目以确保审计框架的普适性。
使用方法
使用CareTransition-Audit数据集需先拥有MIMIC-IV的PhysioNet凭证访问权限,因为本发布内容不包含原始出院小结文本。用户可通过Hugging Face的datasets库直接加载标签数据,代码示例为`ds = load_dataset('CentificAIResearch/CareTransition-Audit')`。该数据集主要用于基准测试大语言模型作为出院文档完整性自动审计员的表现,例如通过Cohen's Kappa、加权F1分数和Spearman秩相关系数计算模型与临床金标准之间的一致性。研究者在应用时需注意,该基准不适合作为临床决策的独立信号,而应作为辅助工具供临床医生审查,且其数据来源于单一医疗机构,泛化性尚未验证。
背景与挑战
背景概述
CareTransition-Audit是由Akshat Dasula、Prasanna Desikan和Jaideep Srivastava等研究人员于2026年发布的一个临床验证基准数据集,旨在审计出院总结的完整性,其成果发表于SD4H @ ICML 2026。该数据集基于MIMIC-IV电子健康记录数据库,通过将DISCHARGED助记符(Ng et al., 2025)操作化为包含46个原子审计问题的检查清单,覆盖人口统计学、重要警报、社会环境、综合病史、体格检查、病程记录、药物变更、护理目标、随访安排及出院信息等十个组件。每个问题由临床专家标注为“是”、“否”、“不清晰”或“不适用”,并附有逐字证据和简短理由。该基准不仅为零样本下评估大语言模型(LLM)作为自动审计员的能力提供了标准化框架,还推动了出院文档完整性评估从人工审查向自动化辅助的范式转变,对减少护理不连续性和避免再入院具有重要临床意义。
当前挑战
CareTransition-Audit面临的核心挑战源于所解决的领域问题与构建过程双重层面。领域方面,出院总结的不完整或不一致是导致护理碎片化和可预防再入院的关键因素,但手动图表审计难以规模化,亟需自动审计工具;然而,完全性不等同于质量,审计仅能识别文档缺口,无法评判临床护理的适当性,且“不清晰”标签可能混淆真正的文档模糊性与模型不确定性,导致下游解读复杂。构建过程中,数据仅来自单一机构(贝斯以色列女执事医疗中心),限制了对其他医疗体系的泛化性;脱敏处理造成的姓名和日期掩蔽可能影响在真实场景中的可迁移性;此外,当前基准仅包含50份总结,难以涵盖不同专科和服务类型的文档模式分布,且单一注释者的标签可能引入主观偏差,需多注释者一致性研究加以验证。
常用场景
经典使用场景
在医疗自然语言处理领域,CareTransition-Audit被设计为衡量出院小结完整性的基准测试工具。研究者可基于该数据集提供的46项原子化审计问题与临床专家标注的真实标签,对大型语言模型在文档完整性审查方面的能力进行系统评估。典型使用方式是将模型生成的审计结果与临床医生的黄金标准进行对比,通过计算Cohen's κ系数、加权F1分数等指标,评判模型在鉴别文档信息缺失、模糊表述与充分记录时的表现。该数据集特别适用于零样本场景下评估LLM在结构化临床文档审计任务中的可靠性。
解决学术问题
该数据集直面出院文书不完整所导致的护理连续性断裂与可避免再入院这一临床痛点。在学术层面,它系统性地解决了两个关键问题:一是将临床抽象概念'文档完整性'转化为可量化、可复现的46项原子化审计指标,弥补了此前缺乏标准化评估框架的空白;二是构建了基于MIMIC-IV的50份临床验证标签,为衡量LLM在临床文档审计这一细粒度决策支持任务上的效能设立了基准。该工作揭示了当前模型对'模糊'类别识别精度极低等系统性局限,为提升医疗AI在真实场景中处理结构化文档的能力提供了重要参考。
实际应用
在实际医疗场景中,CareTransition-Audit可被用于开发自动化出院小结审计系统,辅助临床质控人员快速筛查信息不完整的文书。其设计的审计清单涵盖了人口统计学、过敏警示、社会支持情况、病史查体、药物变更、随访计划等10个关键维度,能够帮助医疗机构在转诊交接环节发现潜在的信息断层。例如,系统可自动标记出缺少过敏信息或出院用药指示不清的案例,经过临床审核后及时修正,从而降低因沟通疏漏导致的不良事件风险,尤其适用于大型医院的高效质控流程和住院医师培训中的文书质量反馈。
数据集最近研究
最新研究方向
CareTransition-Audit数据集聚焦于利用大语言模型自动化审计出院小结的完整性与规范性,弥补传统人工审计低效、难扩展的临床痛点。该基准基于MIMIC-IV真实住院数据,将DISCHARGED临床框架分解为46项原子化审计问题,并由临床专家标注了金标准标签集,覆盖人口学、过敏警报、社会背景、病史、检查评估、药物变更、后续随访等10大维度。近期研究重点在于评估GPT-4、Claude等前沿LLM作为自动化审计员的表现,揭示模型普遍低估文档完整性且难以识别临床模糊性。该工作已入选SD4H@ICML 2026,标志着临床文档质量自动评估从概念验证迈入标准化基准阶段,对降低再入院率、优化患者交接安全具有重要推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务