RealICU-Gench
收藏资源简介:
RealICU是一个基于后见之明标注的基准测试,用于在真实ICU条件下评估大语言模型,其中标签由资深医生在回顾完整患者轨迹后创建。它包含两个数据集:RealICU-Gold(由五位资深ICU医生共识标注)和RealICU-Scale(通过经医生验证的LLM后见之明标注器扩展),涵盖四个医生驱动的任务:患者状态评估、急性问题识别、推荐行动建议和危险行动避免。
RealICU is a benchmark for evaluating Large Language Models (LLMs) in real-world intensive care unit (ICU) settings, with labels created by senior physicians after reviewing full patient trajectories. It comprises two datasets: RealICU-Gold, which is consensus-annotated by five senior ICU physicians, and RealICU-Scale, which is expanded using physician-validated LLM-powered hindsight annotators. The benchmark covers four physician-driven tasks: patient status assessment, acute problem identification, recommended action suggestions, and hazardous action avoidance.
RealICU-Bench 数据集概述
基本信息
- 数据集名称:RealICU-Bench
- 发布时间:2026年(论文预印本)
- 论文地址:http://arxiv.org/abs/2605.13542
- 项目网站:https://chengzhi-leo.github.io/RealICU-Bench/
- 数据集状态:即将发布
核心目标
RealICU 是一个面向重症监护病房(ICU)的大语言模型(LLM)评估基准,旨在评估 LLM 在真实 ICU 条件下对长上下文临床数据的理解与推理能力。与现有基准不同,RealICU 的标签由资深医师在回顾完整患者轨迹后标注,而非基于临床医生的即时行为。
数据集构成
RealICU 包含两个子数据集:
| 数据集 | 数据窗口数 | 患者数 | 标注方式 |
|---|---|---|---|
| RealICU-Gold | 930 | 94 | 五位资深 ICU 医师达成共识的标注 |
| RealICU-Scale | 11,862 | — | 通过经过医生验证的 LLM 标注器(Oracle)扩展 |
四项临床任务
| 任务 | 描述 |
|---|---|
| 🩺 患者状态评估 | 基于所有可用临床数据评估患者当前的整体状况 |
| 🔍 急性问题识别 | 识别需要在后续床边护理中持续关注的急性临床问题 |
| 💊 推荐治疗措施 | 提出适合患者病情的短期治疗建议 |
| ⚠️ 危险行为识别 | 识别对该患者应避免的、可能导致不安全后果的行为 |
配套代理系统:ICU-Evo
RealICU 同时提供了 ICU-Evo 多智能体管道,这是一个基于结构化记忆的观察驱动系统,通过将临床上下文组织成多种记忆类型(模仿临床医生的推理方式),用于研究长程推理能力。
支持的上下文模式
memory:结构化记忆full_history_events:完整历史事件local_events_only:仅局部事件rag_history_events:基于 RAG 的历史事件all:所有模式
数据格式与布局
数据以 Parquet 格式存储,默认目录结构如下:
data/mimic-demo/events # ICU事件记录(生命体征、实验室检查、用药等) data/mimic-demo/icu_stay # ICU住院元数据
评估方法
- 患者状态与急性问题:通过比较模型输出与 Oracle 标注进行评分
- 推荐措施:使用 PubMedBERT 作为匹配后端,评估推荐措施与真实标签的一致性
关键特性
- 事后标注(Hindsight Annotation):标签由医生在完整了解患者轨迹后标注,避免了即时决策中的信息不完整问题
- Oracle 标注器:一个经过医生验证的 LLM,用于扩展标注规模
- 多模态记忆:ICU-Evo 支持动态记忆组织,模拟临床医生推理流程




