遇见数据集

Hounsfield-CoT

收藏
arXiv2026-07-15 更新2026-07-17 收录
官方服务:

资源简介:

Hounsfield-CoT是由国际关系大学和特伦托大学联合创建的大规模三维医学推理数据集,旨在解决多模态大语言模型在三维医学影像理解中缺乏显式空间推理监督的关键问题。该数据集包含11,200条高质量实例,源自CT-RATE数据集,通过创新的切片式数据合成范式构建,模拟放射科医师的逐层诊断工作流程,将全局临床先验转化为细粒度的切片观察并合成为可解释的思维链。其构建过程采用观察者-合成器双智能体框架,严格遵循序列空间追踪、真实三维空间感知和鉴别排除三大临床原则,最终形成推理链与答案高度解耦的结构化数据。该数据集主要应用于增强三维医学影像的空间推理能力,旨在解决传统二维预训练模型在理解复杂三维解剖结构时出现的空间幻觉和部分容积效应等问题,为三维临床诊断提供透明且可解释的推理基础。

Hounsfield-CoT is a large-scale 3D medical reasoning dataset jointly created by the University of International Relations and the University of Trento, aiming to address the key challenge that multimodal large language models (LLMs) lack explicit spatial reasoning supervision in 3D medical image understanding. This dataset contains 11,200 high-quality instances derived from the CT-RATE dataset, and is constructed via an innovative slice-wise data synthesis paradigm. It simulates the layer-by-layer diagnostic workflow of radiologists, transforming global clinical priors into fine-grained slice-level observations and synthesizing them into interpretable chain-of-thought. Its construction adopts an observer-synthesizer dual-agent framework, strictly following three core clinical principles: sequential spatial tracking, real 3D spatial awareness, and differential exclusion, ultimately yielding structured data where the reasoning chain and the final answer are highly decoupled. This dataset is primarily applied to enhance the spatial reasoning capabilities for 3D medical image understanding, aiming to resolve issues such as spatial hallucinations and partial volume effects that arise when traditional 2D pre-trained models comprehend complex 3D anatomical structures, thereby providing transparent and interpretable reasoning foundations for 3D clinical diagnosis.

创建时间:
2026-07-15
原始信息汇总

数据集概述

该数据集与论文 “Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models” 相关,旨在提升医学多模态大语言模型在三维空间推理方面的能力。

核心目标

  • 解决现有多模态大语言模型在三维体数据(3D volumetric data)处理上的瓶颈,尤其是标注不足的问题。
  • 通过数据驱动的方法,将全局临床知识转化为细粒度的逐切片指令轨迹(slice-wise instructional trajectories),增强模型的三维空间追踪和鉴别诊断能力,无需进行资源密集的三维专用预训练。

即将发布的内容

该仓库计划陆续发布以下资源:

  • 数据合成管线(Data Synthesis Pipeline):用于从体数据标注中生成结构化思维链(Chain-of-Thought, CoT)描述的脚本。
  • 训练与微调(Training & Fine-Tuning):高效的LoRA微调方案,用于将二维视觉-语言基线模型与三维临床逻辑对齐。
  • 评估协议(Evaluation Protocols):采用“LLM-as-a-judge”的评估脚本,用于解析三维空间坐标输出结果。

当前状态

  • 代码库、合成推理数据集以及评估脚本正在整理中,准备完成后将公开发布。
搜集汇总
数据集介绍
Hounsfield-CoT 数据集图片
构建方式
Hounsfield-CoT 数据集的构建源于对放射科医师临床阅片流程的深度模拟。该方法摒弃了传统的端到端数据聚合策略,专注于从 CT-RATE 数据集中提取高质量的三维推理轨迹。具体而言,研究提出了一种新颖的 Observer-Synthesizer 双智能体框架:Observer 智能体以全局临床报告为先验,逐切片提取细粒度的局部发现;随后,Synthesizer 智能体将这些离散的观察整合为结构化的链式思维推理过程。在生成过程中,每个推理链均被严格约束以体现三大核心临床原则——顺序空间追踪、真实三维空间感知与鉴别排除。最终,这一流程生成了包含 11.2k 个精筛实例的数据集,所有推理过程封装于 <think> 标签,而最终诊断则置于 <answer> 标签内,确保了格式的高度一致性。
特点
Hounsfield-CoT 数据集的核心特性在于其密集且高度可解释的推理结构。与仅包含扁平问答对或最终报告的现有数据集不同,该数据集显式地展开了逐切片的空间追踪与鉴别诊断过程。值得注意的是,其详细推理链与最终答案的平均 token 长度比高达 92.9:1,这一鲜明对比凸显了其深层目标——推动多模态大语言模型从浅层的视觉-文本映射转向可验证的深度空间推理。此外,数据集覆盖了 3D-RadVQA 基准中的四项核心能力(异常检测、图像观察、医学计算与存在检测),并在格式上实现了开放生成问题与多项选择问题的均衡分布(51.2% 与 48.8%),从而支持全面的评估协议。
使用方法
使用 Hounsfield-CoT 数据集时,研究者可采用一种经济高效的 2D 到 3D 推理迁移策略。具体而言,对于每个 CT 体素,沿 Z 轴提取连续的八个切片,通过标准的 2D 视觉编码器独立处理并嵌入为连续的视觉 token 序列。随后,利用 LoRA 微调技术,在 Hounsfield-CoT 数据集上对预训练的 2D 多模态大语言模型进行指令微调。训练过程中,模型被引导在 <think> 标签内生成推理步骤,再在 <answer> 标签中输出最终答案,从而显式学习将临床发现映射至结构化诊断逻辑。这一流程无需昂贵的原生 3D 预训练或边界框提取,即可有效解锁模型的鲁棒三维空间推理能力,并显著提升其在 3D-RadVQA 等基准上的透明诊断性能。
背景与挑战
背景概述
在医学影像分析领域,多模态大语言模型(MLLMs)在二维图像理解上取得了显著成就,然而向三维体数据(如CT和MRI)的拓展却长期受限于高昂的标注成本与数据集的不透明性。2026年,由国际关系学院与特伦托大学的研究人员联合构建的Hounsfield-CoT数据集应运而生,旨在解决三维医学影像中缺乏显式、可解释推理过程的根本难题。该数据集通过模拟放射科医师的切片式诊断工作流,将全局临床先验转化为细粒度的逐层观察,并整合为结构化的思维链(Chain-of-Thought),从而为三维空间推理提供强有力的监督信号。Hounsfield-CoT的发布填补了现有三维数据集仅包含刚性问答对或无结构最终报告的空白,为医学MLLMs从二维到三维的推理迁移开辟了新路径,在提升模型诊断透明度的同时,显著推动了三维医学影像智能理解领域的发展。
当前挑战
Hounsfield-CoT数据集所应对的核心挑战源自三维医学影像分析的固有复杂性。首先,现有三维数据集普遍缺乏临床对齐的中间推理步骤,导致模型倾向于捷径学习而非真正理解空间结构,无法区分真实三维异常与局部部分容积效应。其次,在构建过程中,需要将全局层面的影像报告分解为逐层、连续的空间推理链,并严格遵循顺序空间追踪、三维空间意识与鉴别排除三大临床原则——这一过程极易因语言先验的干扰而产生空间幻觉,且难以确保合成推理链的临床有效性。此外,面对高达11.2k质量实例的大规模数据集,确保每个推理步骤的逻辑严谨性与结构一致性成为关键挑战,要求合成范式在不依赖昂贵三维预训练的前提下,实现二维预训练模型向三维体数据的鲁棒迁移与透明化推理。
常用场景
经典使用场景
Hounsfield-CoT数据集最经典的使用场景在于为医学多模态大语言模型提供显式的三维空间推理监督信号。该数据集通过创新的切片级数据合成范式,将放射科医生的临床诊断流程转化为可解释的思维链推理路径,特别适用于需要对CT容积数据进行逐层追踪、三维空间感知和鉴别诊断排除的医学视觉问答任务,如器官定位、异常检测和影像观察。
衍生相关工作
Hounsfield-CoT数据集催生了一系列关于三维医学推理的工作,包括基于该数据集衍生的Hounsfield3D模型、跨架构泛化验证(如在Lingshu基线模型上复现性能提升)、以及数据规模消融研究。这些工作共同验证了切片级思维链监督作为模型无关的通用催化剂,能够有效解锁2D预训练模型的三维空间理解能力,为后续三维医学视觉语言模型的透明化推理研究奠定了坚实基础。
数据集最近研究
最新研究方向
在三维医学影像智能解析的前沿疆域中,Hounsfield-CoT数据集开创性地将放射科医师的逐层阅片认知范式融入多模态大语言模型的训练体系。该研究直面当前三维医学视觉问答中推理过程不透明、空间定位能力薄弱的顽疾,通过构建双智能体(Observer-Synthesizer)合成框架,将全局临床报告解构为精细的逐层观察,并强制约束推理链需遵循空间连续性追踪、三维感知抗伪影、鉴别诊断排除三大核心临床原则。基于CT-RATE数据源构建的11.2k高质量实例,成功将2D预训练模型转变为具备可解释空间推理能力的三维诊断引擎,在3D-RadVQA基准上展现出显著性能跃升,其透明的临床逻辑链有效抑制了空间幻觉和部分容积伪影的干扰。这一数据驱动策略不仅为低成本实现三维医学理解提供了新范式,更标志着多模态大语言模型在体数据认知领域从简单模式匹配迈向深度逻辑推理的关键转折。
相关研究论文
  • 1
    Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models国际关系大学; 特伦托大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务