遇见数据集

PathAgentBench

收藏
github2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

PathAgentBench是一个用于评估证据寻求型视觉语言模型在全切片病理图像上性能的基准数据集。它包含多个任务:任务1(证据解释)涉及5,637个图像到文本匹配问题;任务2(证据验证)包含2,780个文本到图像检索问题;任务3A(证据获取)涵盖600个全切片图像中的17,976个查询;任务4(证据整合)有17,949个多尺度诊断推理问题。该数据集旨在测试模型在病理学领域的证据处理能力。

PathAgentBench is a benchmark dataset for evaluating the performance of evidence-seeking vision-language models on whole-slide pathological images. It comprises multiple tasks: Task 1 (Evidence Interpretation) involves 5,637 image-to-text matching questions; Task 2 (Evidence Validation) contains 2,780 text-to-image retrieval questions; Task 3A (Evidence Acquisition) covers 17,976 queries across 600 whole-slide images; Task 4 (Evidence Integration) includes 17,949 multi-scale diagnostic reasoning questions. This dataset aims to test the evidence processing capabilities of models in the field of pathology.

创建时间:
2026-07-19
原始信息汇总

PathAgentBench 数据集概述

PathAgentBench 是一个用于评估病理学领域中 AI 模型在证据处理与诊断推理方面能力的基准数据集。该数据集包含四个主要任务,其核心目标是衡量模型在病理学证据链上的综合能力。

任务概览

任务 评估单元 公开样本数 支持后端
T1 证据解读 图像到文本匹配 5,637 个问题 OpenAI, OpenRouter, vLLM
T2 证据验证 文本到图像检索 2,780 个问题 OpenAI, OpenRouter, vLLM
T3A 证据获取 文本引导的WSI定位 600张WSI上的17,976个查询 OpenAI, OpenRouter, Gemini
T4 证据整合 多尺度诊断推理 17,949 个问题 OpenAI, OpenRouter, vLLM

数据布局

基准数据以 JSON 格式存储在 benchmark/ 目录下:

  • benchmark/task1.json

  • benchmark/task2.json

  • benchmark/task3a.json

  • benchmark/task4.json

  • 任务1、2、4的数据结构是包含 questions 列表及相关元数据的对象。

  • 任务3A的数据以 WSI 名称为键,包含 1040200 三个查询列表。

  • 任务4使用论文中的问题类型 DiagnoseTriageRefine,可通过 --question-type 参数进行筛选。

所需的600张切片列表位于 wsi.json 文件中。下载的切片文件需放置在 data/wsi/{dataset}/{wsi_name}.svs 路径下。

评估榜单

任务1: 图像到文本匹配 - 按所有放大倍率下的准确率(All)排名:

  • 第一名: Gemini-3-Flash (63.48%)
  • 第二名: Kimi-K2.5 (58.08%)
  • 第三名: Qwen-3.5-Flash (54.36%)

任务2: 文本到图像检索 - 按所有放大倍率下的准确率(All)排名:

  • 第一名: Gemini-3-Flash (67.74%)
  • 第二名: GPT-5.2 (60.96%)
  • 第三名: Qwen-3.5-Flash (60.05%)

任务3A: 文本引导定位 - 按三个放大倍率下 mIoU 的未加权平均值排名:

  • 第一名: Qwen-3.5-Flash (0.071)
  • 第二名: GPT-5.2 (0.069)
  • 第三名: Gemini-3-Flash (0.065)

任务3B: 自主肿瘤导航 - 按三个放大倍率下平均无条件命中率排名:

  • 第一名: Gemini-3-Flash (24.22%)
  • 第二名: MedGemma-4B (22.57%)
  • 第三名: MedGemma-27B (22.49%)

任务4: 多尺度诊断推理 - 按所有问题类型下的平衡准确率(All)排名:

  • 第一名: InternVL2.5-8B (93.44%)
  • 第二名: Lingshu-7B (93.41%)
  • 第三名: InternVL2.5-26B (93.16%)

结果与恢复

默认情况下,输出按任务、后端和模型分组,保存在 results/ 目录下。每个运行器支持检查点恢复(wip_*.jsonl),中断后重新运行相同的输出目录将跳过已完成的样本。可使用 --output-dir 参数覆盖默认的输出位置。对于任务1、2、4,使用 --concurrency N 控制请求并发数(默认为1)。任务3A由于涉及有状态的多轮工具调用,按顺序执行。

搜集汇总
数据集介绍
PathAgentBench 数据集图片
构建方式
PathAgentBench是一个用于评估病理学领域自主智能体证据处理能力的综合性基准数据集。该数据集围绕病理学诊断的核心认知流程,精心设计了四项任务:证据解释(T1)、证据验证(T2)、证据获取(T3A)以及证据整合(T4)。在构建过程中,T1任务以图像到文本匹配的形式呈现,包含5637道问题;T2任务则采用文本到图像检索的方式,涵盖2780道问题;T3A任务专注于文本引导的全切片图像定位,涉及600张全切片图像上的17976次查询;T4任务则聚焦于多尺度诊断推理,包含17949道问题。数据集采用JSON格式存储,各任务的数据文件分别命名为task1.json、task2.json、task3a.json和task4.json,并提供了包含600张所需切片的wsi.json清单,每张切片需放置在指定的相对路径下。
使用方法
使用PathAgentBench进行评估的过程简洁而灵活。首先需通过pip安装所需的依赖包,并根据所选的推理后端配置相应的环境变量(如OPENAI_API_KEY或OPENROUTER_API_KEY)。对于T1、T2和T4任务,可通过python evaluation/run_task1.py等脚本并指定模型名称与后端类型来启动评估,其中OpenRouter为默认后端,也可显式切换至openai或vllm。对于T3A任务,由于涉及需要多轮工具调用的交互式全切片定位,其评估仅支持官方已验证的OpenAI和OpenRouter Gemini路径。评估结果会自动保存至指定输出目录,并支持中断续跑功能,通过--concurrency参数可控制请求并发数,而--dry-run选项则可用于验证配置而无需实际发送API请求,极大地方便了用户的调试与使用。
背景与挑战
背景概述
病理诊断作为临床决策的金标准,长期以来依赖病理医师在显微视野下对海量组织切片进行人工判读,这一过程不仅耗时费力,更受限于主观经验差异与可重复性不足。近年来,随着全切片数字化扫描技术的成熟与计算病理学的崛起,多模态大模型在医学影像分析领域展现出巨大潜力。PathAgentBench由国际多中心研究机构联合创建于2024年,旨在系统评估通用与领域专用大模型在病理学全流程中的综合能力,涵盖证据解读、证据验证、证据获取与证据整合四大核心任务。该数据集包含逾两万条精心构建的查询样本与600张全切片病理图像,为计算病理学领域树立了首个端到端标准化评测基准,对推动AI辅助病理诊断的发展具有里程碑式的影响。
当前挑战
PathAgentBench所解决的领域挑战在于病理诊断流程的复杂性与多尺度性:模型需在单一任务中同时掌握跨放大倍数的形态学推理能力,并实现从微观细胞特征到宏观组织结构的精准映射,这对现有视觉语言模型的多尺度感知与长上下文理解能力构成严峻考验。在构建过程中,面临的挑战包括全切片病理图像在10倍、40倍等不同分辨率下的标注一致性维护,以及面向证据获取任务时交互式工具调用轨迹的序列化与验证。此外,多模态数据对齐的非平凡性、公开病理数据集有限的规模与多样性,以及不同数据源间染色差异导致的域迁移问题,均对基准的公平性与泛化性提出了更高要求。
常用场景
经典使用场景
PathAgentBench作为病理学视觉语言模型(VLM)的标准化评估基准,其经典使用场景涵盖四项核心任务:证据解释(Task 1)通过图像-文本匹配衡量模型对病理形态描述的语义理解能力;证据验证(Task 2)以文本引导的图像检索评估模型在多倍率下定位病理特征的表现;证据获取(Task 3A)则要求模型通过多轮工具调用在全切片图像(WSI)中完成文本引导的精准定位;证据整合(Task 4)进一步检验模型在多尺度诊断推理中的综合能力。该基准覆盖了从单维度特征识别到多尺度临床推理的完整评估链条,为病理VLM提供了系统化的能力检测框架。
解决学术问题
PathAgentBench解决了病理学领域中缺乏统一、多维度视觉语言模型评估体系的学术困境。此前研究多聚焦于孤立任务(如分类或分割),难以全面衡量模型在真实病理诊断流程中的综合表现。该基准通过构建包含证据解释、验证、获取与整合的四层次任务体系,系统性地揭示了现有模型在病理证据链推理中的瓶颈,尤其是Task 3A中多数模型在微观尺度定位上的显著缺陷(如Patho-R1-7B的mIoU为0.000)。这一发现推动了针对病理多尺度特性与工具调用能力的模型优化研究,为弥合AI辅助诊断与临床实践之间的鸿沟提供了可量化的改进方向。
实际应用
在临床病理实践中,PathAgentBench评估体系具备多重实际应用价值。Task 1与Task 2可辅助病理科部署自动报告生成系统,通过验证模型对镜下描述与对应区域的匹配精度,确保AI辅助诊断中信息提取的可靠性。Task 3A的WSI定位功能直接服务于肿瘤边界勾勒与核分裂象计数等需要精确空间映射的场景,在数字化病理工作流中减少人工筛查工作量。Task 4的多尺度推理能力则支撑起从初步分诊到细化诊断的递进式决策流程,例如在乳腺癌分级、前列腺癌Gleason评分等任务中提供分层式置信证据,帮助病理医师高效聚焦关键区域。
数据集最近研究
最新研究方向
PathAgentBench作为面向病理学场景的智能体评估基准,其最新研究方向聚焦于构建多维度、多粒度的病理证据链推理能力评估体系。该基准通过将病理诊断流程解构为证据解读、证据核验、证据获取与证据整合四个递进式任务,系统性地考察视觉语言模型在整张切片图像上的细粒度感知、跨尺度检索与自主导航能力。前沿热点包括基于多轮工具调用的全切片定位任务(Task 3A)以及自主肿瘤导航任务(Task 3B),这两项任务突破了传统静态图级别评估的局限,开创性地模拟了病理医生在实际工作中依赖的多尺度交互式诊断场景。该基准的发布揭示了当前顶级模型在证据链推理中的显著短板——即使是表现最优的Gemini-3-Flash在证据解读任务中准确率也仅达63.48%,而肿瘤导航任务中最高平均无条件命中率仅为24.22%,这为开发具备临床级推理能力的新一代病理AI系统提供了明确的方向标尺。此外,该基准通过统一的评估框架和开源的轻量级评测入口,为病理AI领域的可重复性研究设立了新标准,其leaderboard上各模型的显著性能差异不仅暴露了当前视觉语言模型在专业医学图像理解中的局限性,更直接推动了针对病理学特化模型架构与训练策略的深入研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务