MedSP1000
收藏资源简介:
MedSP1000是一个基于标准化患者(SP)的交互式临床代理评估基准,将同行评审的SP教学案例转化为可执行场景,包含患者脚本、临床环境上下文和人工验证的结构化评分标准。它包含1,638个交互式案例,涵盖17个临床专业,使用24,602个评分项进行评分,用于评估大型语言模型在动态临床决策中的表现。
MedSP1000 is an interactive clinical agent evaluation benchmark based on standardized patients (SP). It converts peer-reviewed SP teaching cases into executable scenarios, which include patient scripts, clinical environment contexts, and manually validated structured scoring rubrics. The benchmark contains 1,638 interactive cases covering 17 clinical specialties, utilizes 24,602 scoring items for assessment, and is designed to evaluate the performance of large language models in dynamic clinical decision-making.
MedSP1000 数据集概述
MedSP1000是一个基于标准化病人(Standardized Patients, SP)的交互式临床决策基准数据集,用于动态评估大语言模型(LLMs)在多轮临床诊疗中的表现。
核心特点
- SP驱动:基于同行评审的MedEdPORTAL教学材料构建,涵盖1,073篇源文章和22,244个附件。
- 交互式多轮评估:采用闭环交互模式,临床医生代理、患者代理和环境控制器之间进行标准化状态转换的多轮对话。
- 规模与覆盖面:包含1,638个交互式病例,覆盖17个临床专科,配有24,602个评分项。
- ACGME对齐评分:每项行为均依据6项ACGME核心能力(PC、MK、SBP、ICS、PBLI、PROF)的冻结评分表进行评分。
- 人工验证:病例和诊疗轨迹由12名临床医生验证(每人独立双重评分)。
评估框架
数据集包含三个阶段:
- 数据处理:将异构的MedEdPORTAL材料转化为角色特定的场景包。
- 多代理评估循环:在多个临床状态下进行多轮评估。
- 评估代理评分:依据ACGME六大核心能力对完整诊疗轨迹进行评分。
主要结果
在静态基准测试中的表现不能可靠地转化为交互式临床护理中的表现。最佳通用模型(GPT-5.5)的总体评分表完成率为60.4%,而最强的医学专用模型仅为40.0%。
数据获取
数据集托管在Hugging Face Hub:
- https://huggingface.co/datasets/byrLLCC/MedSP1000
数据布局
每个场景包含各角色代理的材料文件夹,冻结评分表位于仓库的 rubrics/ 目录中:
data/MedSP1000/<case_id>/<scenarioN>/ examinee/ # 临床医生代理可见材料 sp_actor/ # 患者(标准化病人)脚本 environment_controller/ # 实验室/影像/环境状态 evaluator/ # 源评分材料 rubrics/<case_id>_<scenarioN>.json # 用于评分的冻结ACGME评分表
许可证
数据集采用 MIT License 许可。




