遇见数据集

CLIR-Bench

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

CLIR-Bench是一个证据可审计的基准数据集,专门设计用于评估模型在不规则临床时间序列上进行多模态问答的能力。该数据集基于MIMIC-IV数据库中的去识别化重症监护室(ICU)记录构建,包含6,600个多项选择题问答实例,涵盖了11个关键的临床变量和干预信号。问题被系统地分为四个核心能力维度:时间理解、推理、预测和决策制定。每个问题都明确关联了时间戳级别的证据以及特定任务的答案推导规则,使得该基准不仅能评估模型的答案准确性,还能全面评估其证据忠实度(模型输出与证据的一致性)、证据依赖性(模型决策对证据的依赖程度)以及因果敏感性(对因果关系的理解)。CLIR-Bench特别关注临床实践中的常见挑战,如数据稀疏、观测异步、数据缺失和长期视野分析,从而为评估模型能否可靠地基于患者特定时间证据进行推理提供了一个现实且具有诊断性的测试平台。需要注意的是,当前公开的数据集版本不包含源自MIMIC-IV的原始时间序列数据及相关证据,访问这些部分需要研究者通过PhysioNet官方平台申请相应的数据使用权限。

CLIR-Bench is an evidence-auditable benchmark dataset specifically designed to evaluate models ability in multimodal question answering on irregular clinical time series. It is constructed from de-identified intensive care unit (ICU) records in the MIMIC-IV database. The dataset contains 6,600 multiple-choice question-answering instances, covering 11 key clinical variables and intervention signals. The questions are systematically organized into four core competency dimensions: temporal understanding, reasoning, prediction, and decision-making. Each question is explicitly associated with timestamp-level evidence and task-specific answer derivation rules, enabling the benchmark to assess not only answer accuracy but also evidence faithfulness (consistency of model outputs with provided evidence), evidence dependence (extent to which model decisions rely on given evidence), and causal sensitivity (understanding of causal relationships). CLIR-Bench focuses on common clinical challenges such as data sparsity, asynchronous observations, missing data, and long-term horizon analysis, providing a realistic and diagnostic testbed for evaluating whether models can reliably identify and reason based on patient-specific temporal evidence. It should be noted that the currently released dataset version does not include the original time series data and related evidence from MIMIC-IV; access to these components requires researchers to apply for appropriate data usage permissions through the official PhysioNet platform.

创建时间:
2026-07-24
原始信息汇总

数据集概述:CLIR-Bench

CLIR-Bench 是一个面向 不规律临床时间序列的多模态问答 的可审计证据基准数据集。

  • 数据来源:基于 MIMIC-IV 中脱敏的 ICU 记录构建。
  • 规模与内容:包含 6,600 个多项选择问答实例,涵盖 11 个临床变量和干预信号
  • 能力维度:围绕四个核心能力组织——时间理解、推理、预测和决策。
  • 评估特性:每个问题均明确关联时间戳级别的证据和任务特定的答案推导规则,支持对答案准确性、证据忠实性、证据依赖性和因果敏感性进行综合评估。
  • 应用场景:聚焦稀疏、异步、缺失和长时间跨度的临床观察,为评估模型识别和推理患者特定时间证据的能力提供真实且诊断性的测试平台。

⚠️ 重要说明

  • 当前版本 不包含 来自 MIMIC-IV 的时间序列数据和证据。
  • 涉及 MIMIC-IV 相关任务的数据访问需要额外的资质认证和 PhysioNet 的批准。
  • 研究人员可通过官方网站申请访问:MIMIC-IV

相关论文

  • 论文可在此处下载:PDF
搜集汇总
数据集介绍
CLIR-Bench 数据集图片
构建方式
CLIR-Bench是一项专为不规则临床时间序列多模态问答设计的证据可审计基准,基于MIMIC-IV数据库中的去标识化ICU记录构建而成。该基准精心整合了涵盖11种临床变量与干预信号在内的6600道多项选择题实例,并按照时间理解、推理、预测与决策四类核心能力维度进行系统组织。每个问题均明确关联至时间戳级别的证据与任务特定的答案推导规则,从而在评估答案准确性的同时,兼顾证据忠实度、证据依赖性与因果敏感性等维度的综合评测。
特点
该数据集的核心特点在于聚焦于稀疏、异步、缺失及长周期临床观测数据,真实模拟了临床时间序列分析中的典型挑战。通过将多模态信息与可审计的证据机制深度融合,CLIR-Bench不仅考核模型对患者特定时间证据的识别与推理能力,还提供了对模型因果依赖关系的诊断性测试。其证据可审计的设计使得研究者能够深入剖析模型决策的可靠性,为临床AI系统的可信度评估树立了新的标杆。
使用方法
使用时需注意,当前版本的数据集不包含源自MIMIC-IV的时间序列数据及证据,涉及MIMIC-IV相关任务的数据访问需要额外通过PhysioNet的认证与审批。研究者可访问MIMIC-IV官方网站申请权限。获得授权后,用户可结合基准提供的证据规则与评估框架,对多模态问答系统进行全方位的诊断性测试,涵盖答案准确性、证据忠实度及因果敏感性等关键性能指标。
背景与挑战
背景概述
CLIR-Bench是一个面向不规则临床时间序列的多模态问答证据可审计基准,由科研团队基于去标识化的MIMIC-IV重症监护记录构建,旨在应对多模态大模型在医疗时序推理中的核心挑战。该数据集创建于近年,针对临床数据普遍存在的稀疏性、异步性、缺失值与长程依赖特性,精心设计了涵盖时间理解、推理、预测及决策四种核心能力的6,600个多项选择问答实例,横跨11类临床变量与干预信号。其独到之处在于将每个问题锚定至时间戳级别的证据与任务特异性推导规则,从而不仅评估答案准确性,更可审视模型对证据的忠实度与因果敏感性,为可信临床AI的测评提供了坚实范式。
当前挑战
当前核心挑战包含三方面:其一,临床时间序列的固有复杂性——数据的高度稀疏、采样异步、模式缺失与长期观测片段使得模型难以建立连贯的时序表征。其二,多模态推理的忠实性问题——传统基准仅考察答案正确性,忽视了模型是否真正基于临床证据推理,易产生高准确率下的虚假关联。其三,数据获取与隐私瓶颈——因涉及MIMIC-IV受保护健康信息,研究者需通过PhysioNet严格认证才能获取原始时序数据,这限制了基准的便捷复现与广泛采用,加剧了可复现性与开放科学的张力。
常用场景
经典使用场景
CLIR-Bench作为一个面向不规则临床时间序列的多模态问答基准,最经典的使用场景聚焦于评估大语言模型在医学时序数据上的综合推理能力。该数据集涵盖六余道精心构造的选择题,涉及包括生理变量与干预信号在内的十余种临床指标,并围绕时间理解、时序推理、趋势预测及临床决策四大核心能力维度组织数据。其独特之处在于为每个问题提供了细粒度的时间戳级证据与明确的推导规则,从而支持对模型答案准确性、证据忠实度、证据依赖性与因果敏感度进行系统化诊断。在稀疏、异步、缺失与长程观测的真实临床情境中,CLIR-Bench为衡量模型是否能够精准定位并利用患者特异性时序证据提供了极具现实性的测试平台。
衍生相关工作
CLIR-Bench的提出为时序推理与医疗AI交叉领域催生了多项启发性的衍生工作。研究者可基于该基准构建面向证据忠实度优化的多模态预训练模型,发展能够显式注入时间戳级注意力机制的临床问答架构,或设计因果可解释的推理框架以提升在不规则采样数据上的鲁棒性。此外,该数据集的证据结构化方法也激发了关于医疗时间序列中模型可审计性度量指标的系统性研究,例如基于证人证据归属的数值化忠实度评分。一些工作借鉴了CLIR-Bench中多维度诊断性评估的设计理念,将其迁移至其他医疗模态(如影像报告与生理波形的联合问答)的基准构建中。由此可见,CLIR-Bench不仅塑造了临床时间序列问答的评估新范式,更成为推动可解释、可信任医疗AI持续演进的关键实证场域。
数据集最近研究
最新研究方向
CLIR-Bench聚焦于临床不规则时间序列上的多模态问答任务,通过构建包含时序理解、推理、预测与决策四维能力的基准测试,为评估模型在稀疏、异步、缺失及长程临床观测数据上的证据忠实度与因果敏感性提供了诊断性试验场。该数据集基于MIMIC-IV去标识ICU记录,涵盖11种临床变量与干预信号,并锚定时间戳级证据与推演规则,推动可审计AI在重症医学决策支持中的可信应用,成为检验大模型时空推理与临床证据利用能力的前沿标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务