遇见数据集

CORTEX (Clinically Organized Reasoning and sTructured EXplanation)

收藏
arXiv2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

CORTEX是由穆罕默德·本·扎耶德人工智能大学、哈索·普拉特纳研究所及哈利法大学联合构建的胸部CT三维结构化推理基准数据集,旨在为医学多模态大语言模型提供可解释的临床推理监督数据。该数据集基于公开的大规模胸部CT数据集CT-RATE构建,包含76,177条经过验证的四阶段推理轨迹,涵盖开放式视觉问答、封闭式视觉问答及报告生成三类任务,每条轨迹均包含任务理解、视觉观察、诊断推理和答案合成的结构化步骤。数据生成过程采用前沿大语言模型结合临床医生设计的提示模板进行多温度采样,并通过基于规则的过滤和五维评分准则进行质量验证,确保了推理的临床准确性与逻辑一致性。该数据集主要应用于三维胸部CT的可信推理模型训练与评估,致力于解决医学影像诊断中因缺乏结构化监督与分阶段验证协议而导致模型推理不可追溯、难以验证的核心问题。

CORTEX is a 3D structured reasoning benchmark dataset for chest CT, jointly constructed by Mohammed bin Zayed University of Artificial Intelligence (MBZUAI), Hasso Plattner Institute (HPI), and Khalifa University. It aims to provide interpretable clinical reasoning supervision data for medical multimodal large language models (LLMs). Built upon the publicly available large-scale chest CT dataset CT-RATE, this dataset contains 76,177 validated four-stage reasoning trajectories covering three types of tasks: open-ended visual question answering (VQA), closed-ended visual question answering, and report generation. Each trajectory includes structured steps of task understanding, visual observation, diagnostic reasoning, and answer synthesis. The data generation process adopts cutting-edge large language models combined with prompt templates designed by clinicians for multi-temperature sampling, and conducts quality validation through rule-based filtering and a five-dimensional scoring criterion, ensuring the clinical accuracy and logical consistency of the reasoning. This dataset is primarily applied to the training and evaluation of trustworthy reasoning models for 3D chest CT, and is committed to addressing the core issues of untraceable and hard-to-verify model reasoning in medical image diagnosis caused by the lack of structured supervision and staged verification protocols.

创建时间:
2026-06-26
搜集汇总
数据集介绍
CORTEX (Clinically Organized Reasoning and sTructured EXplanation) 数据集图片
构建方式
CORTEX数据集以CT-RATE验证集为基座,涵盖1304名患者的3039次检查及76177个问答对。首先,对原始问答进行推理驱动重构,将原生类别映射为开放式、封闭式和报告生成三类推理类型,并为每个样本附加临床上下文。随后,基于临床专家设计的任务提示模板,利用五种前沿大语言模型在多个温度下生成四阶段推理轨迹,包含任务理解、视觉观察、诊断推理与答案合成,每个阶段均严格依赖前一阶段结果。最后,通过规则门控、五个阶段级评分标准和硬性门控筛选,从超过190万候选轨迹中为每个问题保留最优轨迹,并由三位放射科医师独立验证子集,确保推理质量。
使用方法
CORTEX适用于训练和评估具备可解释推理能力的3D胸部CT多模态大语言模型。用户可将其四阶段结构化的推理轨迹作为监督信号,微调模型使其学会按放射科医生工作流逐步推理:从理解任务到观察影像发现,再到形成假设并排除干扰项,最终合成答案。同时,数据集附带五个阶段级评分标准,可用于对模型推理过程进行逐级质量评估,定位失败环节而非仅检验最终答案。数据集以标准问答形式提供,支持开放式问答、封闭式选择和报告生成三类任务,便于直接集成到现有训练和评估框架中。
背景与挑战
背景概述
CORTEX(Clinically Organized Reasoning and sTructured EXplanation)是由MBZUAI、哈索·普拉特纳研究所和哈利法大学的研究人员于2026年共同构建的结构化推理基准数据集,旨在解决三维胸部CT多模态大语言模型(MLLM)在可解释推理方面的空白。该数据集的核心研究问题在于:现有医学影像问答数据集将专家报告简化为仅含答案的问答对,丢失了连接影像发现与诊断结论的推理链条,且忽略了临床医生依赖的患者病史。CORTEX通过模拟放射科医生的假设-演绎工作流,将推理过程解构为任务理解、视觉观察、诊断推理和答案合成四个阶段,并引入患者临床上下文,为76,177个经过验证的推理轨迹提供结构化监督。该数据集在三维CT推理领域具有里程碑意义,为构建可验证、可信赖的医学影像推理模型奠定了基础。
当前挑战
CORTEX所解决的领域挑战在于:现有三维胸部CT MLLM缺乏结构化推理能力,其自由文本推理难以被解释和验证,且现有基准数据集仅以最终答案评判模型性能,无法确保诊断过程的临床合理性。这种“黑箱”式推理在要求可溯源的放射学环境中尤为危险——一个看似正确的诊断可能源于错误推理路径,导致临床风险。在数据集构建过程中,核心挑战包括:1)如何设计出临床合理且结构化的推理模板,需通过放射科医生多次迭代审查以确保解剖一致性和假设合理性;2)如何从超过190万个候选推理轨迹中筛选出高质量样本,需采用五维度分阶段评估协议(任务理解、观察保真度、假设评估、推理逻辑、答案正确性),并依赖专家级LLM判分器与三名委员会认证放射科医生的独立验证(一致性达93%);3)如何恢复被原始数据集丢弃的临床上下文,将48.1%检查的患者病史与检查指征重新整合到问答对中,以抑制幻觉并增强诊断的临床相关性。
常用场景
经典使用场景
在三维胸部CT影像分析领域,CORTEX数据集的核心应用场景在于为多模态大语言模型提供结构化的推理监督信号。它要求模型不仅输出最终诊断答案,更需遵循放射科医生假设-演绎的临床工作流程,依次完成任务理解、视觉观察、诊断推理和答案合成四个阶段。该数据集尤其适用于开放式视觉问答、封闭式选择题及报告生成三类任务,能够有效检验模型在复杂空间关系推理、跨切片证据整合和临床背景利用方面的能力,为构建可解释、可审计的三维医学影像推理模型奠定了数据基础。
解决学术问题
CORTEX数据集系统性地解决了现有三维胸部CT问答基准中的两个关键学术困境:一是缺乏结构化的推理过程标注,现有数据集仅保留答案-问题对,丢失了从影像发现到临床结论的推理链条;二是缺少针对推理过程的验证协议,传统方法仅评判最终答案的正确性,却无法定位推理步骤中的错误。通过引入四阶段推理轨迹和五维度评分体系,CORTEX使得模型诊断路径的透明化验证成为可能,显著推动了可信任医学多模态大语言模型的发展,为后续研究提供了从训练到评估的完整方法论框架。
实际应用
在临床实践中,CORTEX数据集可用于辅助胸部CT影像的解读与报告生成,尤其适用于需要明确诊断依据的复杂病例。基于该数据集训练的模型能够自动生成包含影像学发现、鉴别诊断逻辑及最终结论的结构化报告,有效减少单步生成中因跳跃式推理导致的漏诊或误诊。此外,其融入的患者病史与检查指征信息使模型具备贴近真实临床决策的语境感知能力,有助于降低影像盲区中的幻觉风险,在急诊胸痛评估、肺结节随访及弥漫性肺病分析等高要求场景中展现出显著的应用潜力。
数据集最近研究
最新研究方向
当前,三维胸部CT多模态大语言模型的推理能力研究正从自由文本式思维链迈向结构化、可验证的诊断推理范式。CORTEX数据集应运而生,它创新性地将放射科医师的假设-演绎工作流解构为任务理解、视觉观察、诊断推理与答案合成四个阶段,为每个问题配以临床背景和阶段级评估协议。这一前沿方向突破了现有数据集仅关注最终答案准确性的局限,通过五维度评分体系实现推理轨迹的逐级验证与质量筛选。在76,177条经放射科专家验证的推理轨迹支撑下,CORTEX不仅为训练具备可解释推理能力的3D胸部CT模型提供了结构化监督信号,更推动了医学影像AI从黑箱预测向可审计、可信赖的临床决策支持系统演进,对提升医学影像诊断的透明度与安全性具有里程碑意义。
相关研究论文
  • 1
    CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs穆罕默德·本·扎耶德人工智能大学; 哈索·普拉特纳研究所; 哈利法大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务