遇见数据集

MedCTA

收藏
github2026-05-24 更新2026-05-26 收录
数据链接:
官方服务:

资源简介:

MedCTA是一个用于评估临床工具代理的基准,专注于多模态医疗任务,通过临床验证的工作流程测试代理在工具选择、调用、证据整合和临床答案生成方面的能力。

MedCTA is a benchmark designed for evaluating clinical tool agents, which focuses on multimodal medical tasks. It leverages clinically validated workflows to assess the agents' capabilities in tool selection, invocation, evidence integration and clinical answer generation.

创建时间:
2026-05-13
原始信息汇总

数据集概述

MedCTA(A Benchmark for Clinical Tool Agents)是一个用于评估临床工具代理的基准测试集,由KAUST的IVUL实验室开发。该测试集旨在模拟真实的临床工作流程,评测基于大语言模型(LLM)的代理能否在临床任务中正确选择工具、调用工具、整合证据并得出有效的临床结论。

核心特点

  • 临床任务:包含 107 个经过临床专家验证的任务。
  • 工具集:提供 5 个可执行工具,涵盖感知、检索、定位和推理。
  • 评估范围:从过程(工具使用)到结果(最终答案)进行多维度评估。
  • 数据规模
    • 基准测试模型:18
    • 自主交互轨迹:1,926
    • 人工标注时间:321 小时
    • 涵盖解剖区域/身体系统:34
    • 每个任务平均工具执行步骤:3.1

任务格式

每个任务被定义为一种结构化数据,包含以下组件:

  • X: 多模态临床上下文
  • Q: 隐式步骤的临床查询
  • U: 隐藏的必要工具子集
  • π: 参考交互轨迹
  • A: 最终临床结果

工具库

MedCTA使用了5个已部署的工具,模拟真实临床工作流程:

工具 功能 典型用途
OCR 文本提取 读取报告、标签、表格、扫描文档
ImageDescription 全局视觉理解 总结医学图像
RegionAttributeDescription 局部视觉检查 描述特定区域或发现
GoogleSearch 外部证据检索 查询临床或生物医学知识
Calculator 数值推理 计算数值、比率、表达式或分数

评估指标

MedCTA从三个角度评估代理,共计9个指标:

1. 工具使用保真度(按步骤)

  • InstAcc: 指令遵循准确率
  • ToolAcc: 工具选择准确率
  • ArgAcc: 工具参数预测准确率
  • SummAcc: 中间总结准确率

2. 临床推理质量

  • Facc: 临床忠实度
  • Cs: 多模态上下文整合
  • Scomp: 语义完整性

3. 最终结果准确率

  • Gacc: 最终目标/答案准确率

已评估模型

MedCTA已对18个模型进行了基准测试,包括API模型和开源模型。

API及封闭模型(部分)

  • GPT-5.4* (OpenAI) - 最终目标准确率 (Gacc): 31.54
  • Claude-opus-4-6* (Anthropic) - 最终目标准确率 (Gacc): 31.32
  • Gemini-3-flash* (Google) - 最终目标准确率 (Gacc): 25.87
  • Claude-haiku-4-5* (Anthropic) - 最终目标准确率 (Gacc): 23.08
  • Gemini-3-flash-lite* (Google) - 最终目标准确率 (Gacc): 23.64

开源模型(部分)

  • Qwen3-8B (Qwen) - 最终目标准确率 (Gacc): 27.80
  • Qwen3.5-9B (Qwen) - 最终目标准确率 (Gacc): 21.64
  • Llama-3.1-8B-Instruct (Meta) - 最终目标准确率 (Gacc): 18.94
  • DeepSeek-R1-Distill-7B (DeepSeek) - 最终目标准确率 (Gacc): 10.61
  • Phi-4 (Microsoft) - 最终目标准确率 (Gacc): 10.65

关键故障诊断

MedCTA的分析揭示了临床工具代理的主要瓶颈:

  • 自动 vs 黄金工具路由:提供正确的工具路径能显著提升最终答案准确率(如Claude-opus-4-6的Gacc从31.32提升至66.40),表明工具规划是主要瓶颈。
  • 主要问题
    • API错误率:64.2%(协议不稳定)
    • 工具使用不足率:99.2%(过早停止)
    • 协议故障率:58.3%(交互过程中断)
    • 工具选择失败率:41.6%(错误动作)
搜集汇总
数据集介绍
MedCTA 数据集图片
构建方式
MedCTA是一个专为评估临床工具代理(Clinical Tool Agents)而设计的基准测试数据集,其构建基于对真实临床工作流程的深入模拟。数据集包含了107项经过临床医生验证的多模态医疗任务,每项任务均由一个五元组(X, Q, U, π, A)构成,其中X为多模态临床语境,Q为步骤隐式的临床查询,U为隐藏的充足工具子集,π为参考交互轨迹,A为最终临床结果。数据集的构建过程耗时321小时进行人工标注,覆盖34个解剖区域或身体系统,每项任务包含2至4个工具步骤,平均工具执行步骤为3.1步。为了评估工具使用的全过程,MedCTA集成了五种可执行工具:OCR、ImageDescription、RegionAttributeDescription、GoogleSearch和Calculator,分别用于文本提取、全局视觉理解、局部视觉检查、外部证据检索和数值推理。整个基准测试基于OpenCompass风格的评估流水线,并结合AgentLego工具部署和LMDeploy模型服务,支持端到端和逐步两种评估模式。
使用方法
使用MedCTA数据集进行评估需要搭建完整的评估流水线。首先,从GitHub仓库克隆项目并下载数据集文件,将其放置在 opencompass/data/ 目录下。接着,准备待评估的模型,通过huggingface-cli下载模型权重,并使用LMDeploy启动模型服务,例如运行 `lmdeploy serve api_server` 命令指定模型路径和端口号。然后,部署工具环境:安装AgentLego并配置相关依赖,申请Serper和Mathpix的API密钥并导出为环境变量,最后启动AgentLego工具服务器。评估过程基于OpenCompass框架,支持两种模式:端到端模式(启用 tool_server,禁用 tool_meta,设置 infer_mode 和 eval_mode 为 'every')和逐步模式(禁用 tool_server,启用 tool_meta,设置模式为 'every_with_gt')。通过修改配置文件 configs/eval_medcta_bench.py 和 configs/datasets/gta_bench.py 来设定模型服务器和工具服务器的IP地址与端口,然后运行 `python run.py` 命令执行推理和评估,可选 `--mode infer`、`--mode eval` 或同时进行。最终,评估结果将以多个指标的形式输出,包括InstAcc、ToolAcc、ArgAcc、SummAcc、Facc、Cs、Scomp和Gacc等,从而全面诊断代理的性能瓶颈。
背景与挑战
背景概述
MedCTA(Med Clinical Tool Agent benchmark)是由沙特阿拉伯阿卜杜拉国王科技大学(KAUST)IVUL实验室于2026年构建的一项基准测试,专门用于评估多模态临床工具代理在真实医疗工作流程中的表现。该数据集的核心研究问题聚焦于:大型语言模型驱动的代理是否能像临床医生一样,通过自主选择工具、执行有效参数调用、整合多模态临床信息并基于证据得出可靠结论。MedCTA涵盖了107项经临床专家验证的任务,涉及5种可执行工具(OCR、图像描述、局部区域描述、谷歌搜索、计算器),以及对18个模型进行的超过1926次自主推理轨迹评估。该基准提出了三步互补评价框架,从工具使用保真度、临床推理质量到最终结局准确率,全面衡量代理的执行过程与结果,为临床人工智能系统的可靠性评估提供了更贴近现实需求的标准化平台。
当前挑战
MedCTA所应对的领域问题在于,现有医学基准测试主要测评最终答案准确性,而忽略了临床推理中多模态、迭代、依赖工具和证据敏感性的本质特征。这使得传统问答范式无法反映真实临床环境中代理需具备的规划、工具选择、参数验证及多模态信息融合等综合能力。在基准构建过程中,团队面临巨大挑战:需要设计出隐式指定任务目标的‘步骤隐含型’临床查询,避免明确告知代理应使用的工具与顺序;注释阶段耗费了321小时的人工验证时间,涵盖34个解剖区域/系统,以确保任务覆盖真实临床场景的多样性。此外,系统评估揭示了关键瓶颈,包括API协议不稳定导致的64.2%错误率、代理过早终止导致的99.2%欠调用率,以及高达58.3%的推理流程崩溃率,这些诊断结果凸显了构建稳定、可信的临床工具代理面临的重大工程与科学挑战。
常用场景
经典使用场景
在临床智能辅助诊断领域,传统的医学问答基准多聚焦于静态知识抽取与单步推理,难以真实反映智能体在复杂临床场景中的执行能力。MedCTA数据集应运而生,它是一套专为评估多模态临床工具智能体而设计的基准,涵盖107项由临床医师验证的任务,涉及医学影像理解、病历文本分析、数值计算及外部知识检索等多维度子任务。其核心使用场景在于要求智能体自主完成工具选择、参数调用、中间证据整合及最终临床判断的完整闭环流程,从根本上将评测从'模型是否答对'转向'模型如何完成任务',为临床智能体的能力边界与决策可解释性提供了前所未有的衡量标准。
解决学术问题
MedCTA数据集聚焦于解决当前医学智能体研究中普遍存在的评测维度单一化与流程透明度缺失的严峻问题。传统评测指标仅关注最终答案的准确率,而忽略了工具使用、参数合法性、信息忠实度及临床推理完整性等关键环节。MedCTA通过提出工具使用保真度、临床推理质量与最终目标正确性三大互补性评估体系,首次实现了对智能体在工具路由、协议稳定性、过早停止等隐性故障的系统性诊断。该数据集揭示了即使性能领先的模型在自主工具规划阶段仍存在显著瓶颈,推动了学术界从'答案中心'向'过程中心'的研究范式转变,为构建可靠、可解释的临床决策支持系统奠定了坚实的评估基石。
实际应用
在实际医疗场景中,MedCTA数据集的引入极大地推动了临床辅助决策系统从实验室原型向真实部署应用的跨越。依托其封装的OCR、影像全局描述、区域属性分析、Google学术搜索与计算器等五类核心工具,MedCTA使得智能体能够模拟医生在影像科、检验科或急诊室中的典型工作流:例如通过OCR提取检验报告关键数值,结合影像局部描述定位病灶区域,再借助外部知识库检索相关临床指南,最终利用计算器完成风险评分。这种端到端的能力验证直接服务于手术规划、药物剂量计算、多学科会诊等高风险场景,为医疗机构提供了一套衡量智能体临床执行能力的量化标尺。
数据集最近研究
最新研究方向
在临床人工智能领域,大语言模型正从静态问答向动态工具代理演进,MedCTA基准应运而生。该数据集聚焦于评估多模态临床工具代理在真实诊疗工作流中的表现,涵盖工具选择、参数调用、证据检索与临床推理等核心能力。当前前沿研究方向集中于诊断代理的流程忠实度与临床推理质量,尤其关注代理在自主规划工具路由时的瓶颈问题。研究揭示,即使最先进的模型如GPT-5.4在最终目标准确率上也仅达31.54%,而提供黄金工具路径可显著提升至49.50%,凸显了工具规划作为主要性能瓶颈。此外,高达64.2%的API错误率与99.2%的过早停止率提示,可靠的临床代理需要更强健的控制器而非仅依赖语言或视觉骨干网络,这为构建可信赖的医学AI系统指明了关键突破方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务