ClinHallu
收藏资源简介:
ClinHallu是一个医学多模态大语言模型(MLLM)基准,用于通过多模态问题、结构化思维链注释和细粒度步骤跟踪来诊断阶段幻觉。它统一了先前医学幻觉基准中通常分散的能力,并识别推理过程中的三种幻觉来源:视觉幻觉、知识幻觉和推理幻觉。
ClinHallu is a medical multimodal large language model (MLLM) benchmark designed to diagnose stage-wise hallucinations via multimodal questions, structured chain-of-thought annotations, and fine-grained step-wise tracking. It unifies the typically scattered capabilities across prior medical hallucination benchmarks, and identifies three sources of hallucinations during the reasoning process: visual hallucinations, knowledge hallucinations, and reasoning hallucinations.
CLINHALLU 数据集详情
1. 基本信息
- 数据集名称:CLINHALLU
- 任务类型:医疗多模态大模型(MLLM)幻觉诊断基准
- 机构:DAMO Academy (Alibaba)
- 代码许可:Apache 2.0
- 发布时间:2026年6月12日
- 论文状态:即将发布(2026年)
2. 数据获取
- 基准数据集可在 Hugging Face 获取:Alibaba-DAMO-Academy/ClinHallu
- 下载命令:
hf download Alibaba-DAMO-Academy/ClinHallu --repo-type dataset --local-dir clinhallu_dataset/
3. 数据集构成
CLINHALLU 是一个用于诊断医疗多模态大模型推理过程中逐阶段幻觉的基准,包含:
- 多模态问题
- 结构化思维链(CoT)标注
- 细粒度步骤追踪
定义了三类幻觉来源:
- 视觉幻觉($H^V$):视觉识别阶段的错误
- 知识幻觉($H^K$):知识回忆阶段的错误
- 推理幻觉($H^R$):推理整合阶段的错误
4. 基准数据子集
数据集集成自以下四个子集(图像文件需通过转换脚本准备):
| 子集名称 | 来源数据集(Hugging Face) |
|---|---|
| VQA-RAD | flaviagiammarino/vqa-rad |
| PathVQA | flaviagiammarino/path-vqa |
| MedFrameQA | SuhaoYu1020/MedFrameQA |
| MedXpertQA-MM | TsinghuaC3I/MedXpertQA |
5. 基准结果概览
| 模型 | 平均准确率↑ | 平均$H^V$↓ | 平均$H^K$↓ | 平均$H^R$↓ |
|---|---|---|---|---|
| Qwen3-VL-Flash | 63.6 | 52.1 | 20.0 | 7.6 |
| Qwen3-VL-Plus | 67.2 | 47.2 | 12.5 | 4.7 |
| Gemini-3-Flash | 80.1 | 25.8 | 4.0 | 2.3 |
| Qwen2.5-VL-7B | 42.7 | 65.9 | 45.5 | 18.1 |
| Qwen3-VL-8B | 51.5 | 60.5 | 33.2 | 7.8 |
| Lingshu-7B | 52.7 | 52.2 | 27.3 | 13.6 |
| MedGemma-4B | 53.2 | 51.1 | 33.4 | 30.5 |
| InternVL3.5-8B | 53.9 | 45.6 | 26.6 | 6.6 |
| Qwen3-VL-32B | 63.8 | 50.8 | 18.8 | 4.4 |
| Qwen3.5-4B | 64.3 | 52.0 | 30.5 | 5.1 |
| Qwen3.5-9B | 69.1 | 41.9 | 18.7 | 4.8 |
6. 评估脚本与使用流程
提供完整的评估流水线,推荐执行顺序:
- 安装依赖并配置
configs/config.yaml - 从 Hugging Face 下载发布的标注基准 JSON
- 使用
convert_xxx.sh脚本准备对应的images/目录 - 运行基线模型思维链生成
- 运行替换实验
- 运行答案准确率评估
- 运行步骤级幻觉评估
- 导出最终结果
依赖环境参考:Python 3.11, PyTorch 2.10.0, vllm 0.19.1, transformers 5.5.4。




