遇见数据集

ClinHallu

收藏
github2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

ClinHallu是一个医学多模态大语言模型(MLLM)基准,用于通过多模态问题、结构化思维链注释和细粒度步骤跟踪来诊断阶段幻觉。它统一了先前医学幻觉基准中通常分散的能力,并识别推理过程中的三种幻觉来源:视觉幻觉、知识幻觉和推理幻觉。

ClinHallu is a medical multimodal large language model (MLLM) benchmark designed to diagnose stage-wise hallucinations via multimodal questions, structured chain-of-thought annotations, and fine-grained step-wise tracking. It unifies the typically scattered capabilities across prior medical hallucination benchmarks, and identifies three sources of hallucinations during the reasoning process: visual hallucinations, knowledge hallucinations, and reasoning hallucinations.

创建时间:
2026-06-03
原始信息汇总

CLINHALLU 数据集详情

1. 基本信息

  • 数据集名称:CLINHALLU
  • 任务类型:医疗多模态大模型(MLLM)幻觉诊断基准
  • 机构:DAMO Academy (Alibaba)
  • 代码许可:Apache 2.0
  • 发布时间:2026年6月12日
  • 论文状态:即将发布(2026年)

2. 数据获取

  • 基准数据集可在 Hugging Face 获取:Alibaba-DAMO-Academy/ClinHallu
  • 下载命令:hf download Alibaba-DAMO-Academy/ClinHallu --repo-type dataset --local-dir clinhallu_dataset/

3. 数据集构成

CLINHALLU 是一个用于诊断医疗多模态大模型推理过程中逐阶段幻觉的基准,包含:

  • 多模态问题
  • 结构化思维链(CoT)标注
  • 细粒度步骤追踪

定义了三类幻觉来源:

  • 视觉幻觉($H^V$):视觉识别阶段的错误
  • 知识幻觉($H^K$):知识回忆阶段的错误
  • 推理幻觉($H^R$):推理整合阶段的错误

4. 基准数据子集

数据集集成自以下四个子集(图像文件需通过转换脚本准备):

子集名称 来源数据集(Hugging Face)
VQA-RAD flaviagiammarino/vqa-rad
PathVQA flaviagiammarino/path-vqa
MedFrameQA SuhaoYu1020/MedFrameQA
MedXpertQA-MM TsinghuaC3I/MedXpertQA

5. 基准结果概览

模型 平均准确率↑ 平均$H^V$↓ 平均$H^K$↓ 平均$H^R$↓
Qwen3-VL-Flash 63.6 52.1 20.0 7.6
Qwen3-VL-Plus 67.2 47.2 12.5 4.7
Gemini-3-Flash 80.1 25.8 4.0 2.3
Qwen2.5-VL-7B 42.7 65.9 45.5 18.1
Qwen3-VL-8B 51.5 60.5 33.2 7.8
Lingshu-7B 52.7 52.2 27.3 13.6
MedGemma-4B 53.2 51.1 33.4 30.5
InternVL3.5-8B 53.9 45.6 26.6 6.6
Qwen3-VL-32B 63.8 50.8 18.8 4.4
Qwen3.5-4B 64.3 52.0 30.5 5.1
Qwen3.5-9B 69.1 41.9 18.7 4.8

6. 评估脚本与使用流程

提供完整的评估流水线,推荐执行顺序:

  1. 安装依赖并配置 configs/config.yaml
  2. 从 Hugging Face 下载发布的标注基准 JSON
  3. 使用 convert_xxx.sh 脚本准备对应的 images/ 目录
  4. 运行基线模型思维链生成
  5. 运行替换实验
  6. 运行答案准确率评估
  7. 运行步骤级幻觉评估
  8. 导出最终结果

依赖环境参考:Python 3.11, PyTorch 2.10.0, vllm 0.19.1, transformers 5.5.4。

搜集汇总
数据集介绍
ClinHallu 数据集图片
构建方式
在医疗影像与临床推理领域,多模态大语言模型(MLLM)的幻觉问题严重制约了其可靠性。ClinHallu 基准数据集应运而生,其构建方式独具匠心,旨在系统性诊断医疗 MLLM 在逐步推理过程中出现的幻觉。数据集融合了 VQA-RAD、PathVQA、MedFrameQA 和 MedXpertQA 等既有权威医学问答资源,汇集了涵盖放射影像、病理图像及专家级医学知识的多模态问题。每个样本均配备了结构化的思维链(CoT)标注,包括视觉识别、知识回忆和推理整合三个关键阶段,为精细化分析模型推理错误提供了坚实基础。
特点
ClinHallu 的核心特点在于其对医疗 MLLM 推理中幻觉的阶段性精细诊断能力。不同于传统基准仅关注最终答案的准确性,该基准将幻觉拆解为三种独立来源:视觉幻觉(H^V)、知识幻觉(H^K)和推理幻觉(H^R)。通过巧妙设计的替换实验范式——在模型推理过程中分别用真实标准替换视觉识别、知识回忆或两者——能够精准归因各阶段的错误贡献。例如,替换知识回忆后残留的视觉幻觉率即归因于 H^V,这种机制化诊断方法揭示了模型在临床推理链条中的脆弱环节。
使用方法
使用 ClinHallu 基准需要遵循一套标准化的评估流程。首先,从 Hugging Face 下载包含黄金标准 CoT 注释的基准 JSON 文件,并运行转换脚本准备对应的医学图像目录。随后,针对待评估模型,通过调用 vLLM 服务器生成其自身的思维链推理结果。关键步骤在于执行三项替换实验(replace_vr、replace_kr、replace_vr_kr),分别注入黄金标准的视觉或知识阶段。接着,利用独立的评判模型对答案准确性和各阶段幻觉率进行自动化评估。最终,通过汇总脚本输出包含准确率、H^V、H^K 和 H^R 指标的对比表格,实现对模型推理质量的全面诊断。
背景与挑战
背景概述
在多模态大语言模型(MLLM)于医学影像分析领域蓬勃发展的背景下,模型在生成诊断推理时时常产生与临床事实相悖的幻觉,严重制约了其落地应用。为系统诊断此类幻觉,阿里巴巴达摩院团队于2026年发布了ClinHallu基准数据集,由Sicheng Yang等学者精心构建。该数据集融合了VQA-RAD、PathVQA等四个医学视觉问答子集,创新性地将推理过程中的幻觉解构为视觉识别、知识回忆与推理整合三个阶段,并配备了结构化思维链标注与细粒度评估管线。凭借其独特的阶段式诊断能力,ClinHallu为衡量医学MLLM的推理可靠性提供了权威标尺,在相关研究中产生了深远影响。
当前挑战
ClinHallu所应对的核心挑战在于医学MLLM推理中幻觉来源的细粒度识别与量化。传统指标仅笼统评估答案正确性,无法区分视觉误读、知识谬误或逻辑断层等不同阶段的错误,致使模型改进缺乏精准方向。此外,基准构建本身也面临严峻挑战:如何为多源医学影像问题设计合理且一致的三阶段推理链、如何保证人工标注的思维链在复杂临床语境下不引入新的主观偏差、以及如何设计替换实验以无偏地隔离各阶段幻觉率,均需精密的方法学支撑。这些挑战共同决定了ClinHallu在推动医学AI可信推理方面不可或缺的价值。
常用场景
经典使用场景
在医学多模态大语言模型(MLLM)的研究中,ClinHallu被广泛用作诊断模型在推理各阶段产生幻觉的基准评测数据集。研究者利用其构建的多模态临床问题和结构化思维链(CoT)标注,系统性地拆解模型在视觉识别、知识召回和推理整合三个阶段的错误倾向。通过将模型输出的CoT轨迹与标注的金标准进行对比,可以在细粒度上定位幻觉产生的根源,从而告别以往仅依赖最终答案准确率的粗粒度评估方式,为医学MLLM的可靠性分析提供了精准的度量工具。
实际应用
在真实的临床辅助决策场景中,ClinHallu被用于测试和筛选适合部署的医学多模态模型。例如,医院信息系统在引入AI辅助阅片或诊断建议功能前,可以利用该数据集评估不同模型在胸部X光片解读、病理图像分析等任务上的幻觉风险。若模型在H^V(视觉识别)上表现不佳,则提示其在解剖结构定位或病灶检测方面存在缺陷,需加强视觉编码能力;若H^R(推理整合)偏高,则说明其临床逻辑链条脆弱,不适合直接用于复杂鉴别诊断。这种分阶段的风险画像,为模型的临床应用提供了科学的准入参考。
衍生相关工作
ClinHallu的出现催生了一系列围绕医学MLLM幻觉诊断与缓解的后续工作。部分研究者借鉴其阶段式幻觉分析框架,开发了针对特定医学影像模态的定向幻觉检测器;另一方向的工作则基于其揭示的视觉与知识幻觉模式,提出了带有反事实对抗训练的稳健微调方法。此外,该数据集的替换实验设计启发了其他领域(如法律文本审核、自动驾驶感知)的幻觉诊断基准构建。这些衍生研究共同推动了从‘答案正确性’到‘推理过程可靠性’的范式转变,使AI模型在关键领域的评测标准更加严谨和立体。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务