EviPathBench
收藏数据链接:
官方服务:
资源简介:
基于病理全切片图像的视觉语言模型证据获取与推理基准测试
Benchmark for Evidence Acquisition and Reasoning of Vision-Language Models Based on Pathology Whole Slide Images
创建时间:
2026-07-19
原始信息汇总
EviPathBench 数据集概述
EviPathBench 是一个用于评估视觉语言模型(VLM)智能体是否能够遵循病理学家式从根到叶的诊断流程的基准数据集,涵盖证据解读、核验、获取与多尺度整合四个核心环节。
任务构成
| 任务 | 评估单元 | 公开样本量 | 支持后端 |
|---|---|---|---|
| T1 证据解读 | 图像-文本匹配 | 5,637 个问题 | OpenAI、OpenRouter、vLLM |
| T2 证据核验 | 文本-图像检索 | 2,780 个问题 | OpenAI、OpenRouter、vLLM |
| T3A 证据获取 | 文本引导的 WSI 定位 | 600 张 WSI 上 17,976 条查询 | OpenAI、OpenRouter Gemini |
| T4 证据整合 | 多尺度诊断推理 | 17,949 个问题 | OpenAI、OpenRouter、vLLM |
任务内容
- T1 证据解读:给定病理图像与文本描述的匹配判断。
- T2 证据核验:根据文本描述检索对应的病理图像。
- T3A 证据获取:交互式多轮工具调用,在整张切片图像(WSI)上完成文本引导的区域定位。
- T4 证据整合:涵盖分诊(Triage)、诊断(Diagnose)和细化(Refine)三类问题的多尺度诊断推理。
注:论文中的任务 3B(自主肿瘤导航)虽在排行榜中报告,但未包含在本公开版本的评估代码中。公开版本采用精选的 600 张 WSI 子集。
数据格式与目录布局
评估 JSON 文件存放于 benchmark/ 目录下:
benchmark/ ├── task1.json ├── task2.json ├── task3a.json └── task4.json
- 任务 1、2、4 为包含
questions列表及元数据的对象。 - 任务 3A 按 WSI 名称索引,包含
10、40、200三个放大倍数的查询列表。 - 任务 4 使用面向论文的问题类型
Diagnose、Triage、Refine,可通过--question-type过滤。 wsi.json列出 600 张所需切片,需按记录路径存放至data/wsi/{dataset}/{wsi_name}.svs。
运行方式
- 安装依赖:
pip install -r requirements.txt,并配置相应 API 密钥。 - 可通过
--backend选择openai、openrouter或vllm(任务 3A 仅支持 OpenAI 与 OpenRouter Gemini 路径)。 - 支持
--dry-run验证数据集与命令,不实际发送 API 请求。 - 结果默认按任务、后端、模型分组输出至
results/{task}/{backend}_{model}/,支持断点续跑。
排行榜亮点
- 任务 1:Gemini-3-Flash 以 63.48% 总准确率居首。
- 任务 2:Gemini-3-Flash 以 67.74% 总准确率居首。
- 任务 3A:Qwen-3.5-Flash 平均 mIoU 最高(0.071),Patho-R1-7B 为 0.000。
- 任务 3B:Gemini-3-Flash 平均无条件命中率最高(24.22%)。
- 任务 4:InternVL2.5-8B 以 93.44% 平衡准确率居首。
搜集汇总
数据集介绍

构建方式
EviPathBench是一个面向病理学视觉语言模型(VLM)智能体的综合评估基准,其设计理念源于病理医生遵循的“从根到叶”的诊断流程。该基准通过四个核心任务构建:证据解释(图像-文本匹配)、证据验证(文本-图像检索)、证据获取(文本引导的全切片图像定位)以及证据整合(多尺度诊断推理)。公共数据集包含5,637个图像-文本匹配问题、2,780个文本-图像检索问题、覆盖600张全切片图像的17,976个定位查询以及17,949个诊断推理问题,所有问题均基于精心筛选的临床病理数据构建,并附有元数据与标注,确保评估的全面性与专业性。
特点
EviPathBench的独特之处在于其任务设计紧密模拟病理学家的实际工作流程,强调证据链的完整性与多尺度分析能力。基准涵盖从低倍镜到高倍镜的多种放大倍率,并针对不同任务提供了细粒度的评估指标,如任务1与任务2的准确率、任务3A的平均交并比(mIoU)及任务4的平衡准确率。此外,基准支持多种主流模型后端(OpenAI、OpenRouter、vLLM),并允许用户通过命令行灵活配置,同时提供了断点续跑功能,便于大规模评估。其公开的排行榜与结果可视化工具,为模型性能对比提供了直观参考。
使用方法
使用者首先需安装依赖(pip install -r requirements.txt)并配置相应API密钥。针对不同任务,可运行对应的Python脚本(如run_task1.py)并指定模型与后端,例如使用OpenRouter后端时可通过--model参数选择具体模型,而vLLM后端则需提供OpenAI兼容的端点地址。任务3A因涉及多轮工具调用,目前仅支持官方OpenAI路径及验证过的OpenRouter Gemini路径。用户可通过--dry-run模式验证数据与命令配置,而不实际发送API请求;--output-dir可自定义结果存储位置,--concurrency控制并发请求数。对于任务4,还可通过--question-type筛选问题类型。详细参数可通过运行脚本的--help选项查看。
背景与挑战
背景概述
EviPathBench,作为病理学视觉语言模型(VLM)智能体评估的前沿基准,由研究团队于近期精心构建,旨在模拟病理学家从证据解读到多尺度整合的完整诊断流程。该基准涵盖四项核心任务,包括图像-文本匹配、文本-图像检索、文本引导的WSI定位及多尺度诊断推理,并基于600张全切片图像(WSI)的精选子集,提供了超过44,000个公开测试样本。EviPathBench的诞生,源于对现有病理AI评估方法碎片化、缺乏系统性诊断路径模拟的深刻洞察,其通过精细的任务设计与严格的评测协议,为衡量VLM智能体在复杂病理环境中的证据处理能力树立了新标杆,对推动计算病理学与临床决策支持系统的智能化进程具有重要意义。
当前挑战
EviPathBench所面临的挑战多维且严峻。在领域层面,其需攻克病理图像分析中固有的多尺度特征解析、跨分辨率信息整合以及高保真证据链构建等核心难题,现有模型在各任务上的表现,如Task 1最佳准确率仅63.48%,Task 3A平均mIoU低至0.071,凸显了智能体在细粒度证据解读与定位上的显著不足。在构建层面,基准的创建需克服WSI数据的高维度处理、复杂标注的准确性保证,以及多任务评估协议的统一性维护等重重障碍。尤为棘手的是Task 3A的交互式定位任务,其要求模型具备多轮工具调用能力,且不同模型序列化工具调用的方式差异,导致通用适配器难以兼容,构成了基准扩展与模型评测的重大技术瓶颈。
常用场景
经典使用场景
EviPathBench作为病理学视觉语言模型评估基准,其经典使用场景在于系统性地检验模型是否具备遵循病理学家式、从根到叶的诊断流程的能力。该基准精心设计了四项核心任务,涵盖从影像到文本的证据解读、从文本到影像的证据核查、基于文本引导的全切片图像定位,以及多尺度证据整合的诊断推理。研究者可借助其标准化的评估接口,对各类视觉语言模型进行量化测评,从而在统一框架下比较不同模型在病理诊断链路上的表现优劣。
解决学术问题
该数据集针对当前病理视觉语言模型研究中缺乏系统性评估工具的问题,填补了该领域空白。传统评估往往局限于单一任务或简单图像分类,忽视了病理诊断中证据获取、验证与整合的复杂流程。EviPathBench通过构建多任务、多尺度、交互式评估体系,解决了如何客观衡量模型在真实病理工作流中认知能力的关键难题,为模型开发提供了明确的性能指标,推动了病理AI从局部任务优化向全流程诊断能力提升的范式转变,其学术意义在于建立了连接计算机视觉与临床病理认知评估的桥梁。
衍生相关工作
EviPathBench的发布催生了多项衍生研究工作。其一,其多任务架构启发了针对病理领域特定技能的细分基准构建,如专门的肿瘤区域定位或免疫组化解读评估集。其二,其公开的排行榜数据成为后续研究比较的基线,推动了如模型校准、不确定性估计在病理场景中的应用探索。其三,该基准所暴露的现有模型在证据整合与多尺度导航中的短板,直接促进了病理专用多模态模型、智能体框架及强化学习微调策略的研发。此外,其评估流程设计也被其他医学影像域借鉴,引致了跨模态、跨任务的通用医学AI评估范式研究,形成良性学术生态循环。
以上内容由遇见数据集搜集并总结生成



