PathAgentBench
收藏资源简介:
PathAgentBench是一个用于评估证据寻求型视觉语言模型在全切片病理图像上性能的基准数据集。它包含多个任务:任务1(证据解释)涉及5,637个图像到文本匹配问题;任务2(证据验证)包含2,780个文本到图像检索问题;任务3A(证据获取)涵盖600个全切片图像中的17,976个查询;任务4(证据整合)有17,949个多尺度诊断推理问题。该数据集旨在测试模型在病理学领域的证据处理能力。
PathAgentBench is a benchmark dataset for evaluating the performance of evidence-seeking vision-language models on whole-slide pathological images. It comprises multiple tasks: Task 1 (Evidence Interpretation) involves 5,637 image-to-text matching questions; Task 2 (Evidence Validation) contains 2,780 text-to-image retrieval questions; Task 3A (Evidence Acquisition) covers 17,976 queries across 600 whole-slide images; Task 4 (Evidence Integration) includes 17,949 multi-scale diagnostic reasoning questions. This dataset aims to test the evidence processing capabilities of models in the field of pathology.
PathAgentBench 数据集概述
PathAgentBench 是一个用于评估病理学领域中 AI 模型在证据处理与诊断推理方面能力的基准数据集。该数据集包含四个主要任务,其核心目标是衡量模型在病理学证据链上的综合能力。
任务概览
| 任务 | 评估单元 | 公开样本数 | 支持后端 |
|---|---|---|---|
| T1 证据解读 | 图像到文本匹配 | 5,637 个问题 | OpenAI, OpenRouter, vLLM |
| T2 证据验证 | 文本到图像检索 | 2,780 个问题 | OpenAI, OpenRouter, vLLM |
| T3A 证据获取 | 文本引导的WSI定位 | 600张WSI上的17,976个查询 | OpenAI, OpenRouter, Gemini |
| T4 证据整合 | 多尺度诊断推理 | 17,949 个问题 | OpenAI, OpenRouter, vLLM |
数据布局
基准数据以 JSON 格式存储在 benchmark/ 目录下:
-
benchmark/task1.json
-
benchmark/task2.json
-
benchmark/task3a.json
-
benchmark/task4.json
-
任务1、2、4的数据结构是包含
questions列表及相关元数据的对象。 -
任务3A的数据以 WSI 名称为键,包含
10、40和200三个查询列表。 -
任务4使用论文中的问题类型
Diagnose、Triage和Refine,可通过--question-type参数进行筛选。
所需的600张切片列表位于 wsi.json 文件中。下载的切片文件需放置在 data/wsi/{dataset}/{wsi_name}.svs 路径下。
评估榜单
任务1: 图像到文本匹配 - 按所有放大倍率下的准确率(All)排名:
- 第一名: Gemini-3-Flash (63.48%)
- 第二名: Kimi-K2.5 (58.08%)
- 第三名: Qwen-3.5-Flash (54.36%)
任务2: 文本到图像检索 - 按所有放大倍率下的准确率(All)排名:
- 第一名: Gemini-3-Flash (67.74%)
- 第二名: GPT-5.2 (60.96%)
- 第三名: Qwen-3.5-Flash (60.05%)
任务3A: 文本引导定位 - 按三个放大倍率下 mIoU 的未加权平均值排名:
- 第一名: Qwen-3.5-Flash (0.071)
- 第二名: GPT-5.2 (0.069)
- 第三名: Gemini-3-Flash (0.065)
任务3B: 自主肿瘤导航 - 按三个放大倍率下平均无条件命中率排名:
- 第一名: Gemini-3-Flash (24.22%)
- 第二名: MedGemma-4B (22.57%)
- 第三名: MedGemma-27B (22.49%)
任务4: 多尺度诊断推理 - 按所有问题类型下的平衡准确率(All)排名:
- 第一名: InternVL2.5-8B (93.44%)
- 第二名: Lingshu-7B (93.41%)
- 第三名: InternVL2.5-26B (93.16%)
结果与恢复
默认情况下,输出按任务、后端和模型分组,保存在 results/ 目录下。每个运行器支持检查点恢复(wip_*.jsonl),中断后重新运行相同的输出目录将跳过已完成的样本。可使用 --output-dir 参数覆盖默认的输出位置。对于任务1、2、4,使用 --concurrency N 控制请求并发数(默认为1)。任务3A由于涉及有状态的多轮工具调用,按顺序执行。




