遇见数据集

MedSP1000

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

MedSP1000是一个基于标准化病人(Standardized Patient, SP)衍生的交互式基准数据集,旨在评估大语言模型作为临床代理的能力。与静态、单轮医疗问答数据集不同,该数据集中的每个项目都是一个可执行的多轮交互式临床诊疗场景。在这种场景中,临床医生代理与病人代理以及环境控制器在闭环中进行多轮交互,并遵循标准化的状态转换协议。临床医生代理在整个诊疗过程中的行为,会依据一个专家定义且经过人工验证的评分细则进行持续评估和打分。该基准数据集直接构建于经过同行评审的MedEdPORTAL标准化病人教学材料之上,通过一个智能数据处理流程,将异质的原始文章转化为特定角色(如临床医生、病人、环境、评估者)的场景数据包。数据集规模庞大,包含1,638个交互式案例,覆盖17个临床专业,并包含24,602个评分细则项。评分体系严格遵循美国毕业后医学教育认证委员会(ACGME)的六大核心能力:病人照护、医学知识、基于系统的实践、人际与沟通技巧、基于实践的学习与改进以及职业精神。每个临床医生的行动都会根据这六大能力对应的固定评分细则进行打分,最终得分是完成整个诊疗轨迹中专家定义的评分细则项的比例。所有案例和轨迹都经过临床医生的独立双重评分验证,确保了数据质量。数据集适用于文本生成、问答等任务,尤其专注于医疗、临床、健康护理、交互式评估和基准测试等应用场景。

MedSP1000 is an interactive benchmark dataset derived from Standardized Patients (SP), aimed at evaluating the capabilities of Large Language Models (LLMs) as clinical agents. Unlike static, single-turn medical question answering datasets, each entry in this dataset is an executable multi-turn interactive clinical consultation scenario. In such scenarios, the clinician agent, patient agent, and environment controller conduct closed-loop multi-round interactions in accordance with a standardized state transition protocol. The actions of the clinician agent throughout the entire consultation process are continuously assessed and scored against an expert-defined and manually validated scoring rubric. This benchmark dataset is directly constructed on peer-reviewed Standardized Patient teaching materials from MedEdPORTAL, and converts heterogeneous original articles into scenario data packages for specific roles (e.g., clinician, patient, environment, evaluator) through an intelligent data processing workflow. The dataset is large-scale, containing 1,638 interactive cases covering 17 clinical specialties, and includes 24,602 scoring rubric items. The scoring system strictly follows the six core competencies of the Accreditation Council for Graduate Medical Education (ACGME): Patient Care, Medical Knowledge, System-Based Practice, Interpersonal and Communication Skills, Practice-Based Learning and Improvement, and Professionalism. Each action taken by the clinician is scored against the fixed scoring rubrics corresponding to these six competencies, and the final score is the proportion of expert-defined scoring rubric items completed across the entire clinical consultation trajectory. All cases and trajectories have undergone independent double rating and verification by clinicians to ensure data quality. The dataset is applicable to tasks such as text generation and question answering, with a particular focus on application scenarios including medical, clinical, healthcare, interactive evaluation and benchmark testing.

创建时间:
2026-06-02
原始信息汇总

MedSP1000 数据集概述

基本信息

  • 许可证: MIT
  • 语言: 英文
  • 任务类别: 文本生成、问答
  • 数据集规模: 1K < n < 10K
  • 标签: 医疗、临床、医疗保健、标准化病人、智能体、交互式评估、基准测试、ACGME

数据集简介

MedSP1000 是一个基于标准化病人(Standardized Patient)构建的交互式基准测试,用于评估大语言模型作为临床智能体的动态临床决策能力。与静态的单轮医学问答不同,每个样本是一个可执行的多轮问诊场景:临床智能体与病人智能体、环境控制器在连续的患者状态下进行闭环交互,其行为根据专家定义并经过人工验证的评分标准进行评分。

数据来源

基准测试建立在经同行评审的 MedEdPORTAL 标准化病人教学材料之上,通过智能体数据处理流水线将异构源文章转换为角色特定的场景包。每个发布的病例都保留到原始 MedEdPORTAL 文章的可追溯映射。

主要特点

  • 🏥 标准化病人基础:源自同行评审的 MedEdPORTAL 教学材料
  • 🔁 交互式多轮:临床智能体、病人智能体和环境控制器之间的闭环问诊,具有标准化的状态转换协议
  • 📊 规模与广度:覆盖 17 个临床专科,共 1,638 个交互式病例,包含 24,602 个评分项
  • 🧭 ACGME 对齐评分:每个动作根据 6 项 ACGME 核心能力(患者护理、医学知识、基于系统的实践、人际沟通技能、基于实践的学习与改进、专业精神)的固定评分表进行评分
  • 👩‍⚕️ 人工验证:病例和轨迹由临床医生检查并进行独立双重评分

数据集结构

每个场景包包含四个角色智能体(临床医生/病人/环境/评估者)的材料以及用于评分的固定 ACGME 评分表。可通过以下方式加载: python from datasets import load_dataset ds = load_dataset("byrLLCC/MedSP1000")

评分方式

评分遵循 ACGME 核心能力 框架。每个临床动作根据六项能力对应的固定评分表进行评分。一次运行的得分是完整轨迹中完成的专家定义评分项的比例。

引用

bibtex @article{liang2026medsp1000, title = {MedSP1000: Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases}, author = {Liang, Cheng and Qiu, Pengcheng and Zhang, Ya and Wang, Yanfeng and Wu, Chaoyi and Xie, Weidi}, journal = {<Venue>}, year = {2026}, url = {https://arxiv.org/abs/XXXX.XXXXX} }

搜集汇总
数据集介绍
MedSP1000 数据集图片
构建方式
MedSP1000的构建根植于同行评审的MedEdPORTAL标准化病人教学材料,通过一个自主智能体数据处理流水线,将异质化的源文献转化为角色专属的情境数据包。每个数据包囊括了临床医师、患者、环境及评估者四个角色的交互协议,并附带了经专家定义与人工验证的冻结评分细则,从而构建出可执行的多轮临床对话场景。
使用方法
用户可通过HuggingFace datasets库便捷加载该数据集,使用`load_dataset("byrLLCC/MedSP1000")`命令即可获取数据。每个数据包内含临床医师、患者、环境与评估者四个角色的交互场景定义,以及用于评分的ACGME核心能力细则。研究者可基于这些材料驱动多轮代理交互,并依据冻结的评分细则对临床智能体的行为进行自动量化评分。
背景与挑战
背景概述
在医学教育领域,标准化病人(Standardized Patient, SP)被广泛用于评估临床决策能力,然而现有大语言模型(LLM)的医学评估多局限于静态、单轮问答,难以捕捉真实临床环境的动态交互特性。MedSP1000数据集由Liang等人于2026年创建,源自经同行评审的MedEdPORTAL教学材料,旨在构建一个基于标准化病人的交互式基准,用于评估LLM在多轮临床决策中的表现。该数据集由上海交通大学等多个机构联合开发,覆盖17个临床专科,包含1,638个交互式病例和24,602个评分条目,其评分体系与美国毕业后医学教育认证委员会(ACGME)的六大核心能力对齐。MedSP1000的提出填补了动态临床评估工具的空白,为LLM在医疗领域的安全应用提供了重要验证平台。
当前挑战
MedSP1000所解决的领域问题核心在于,传统医学评估方法多依赖静态考题或标准化测试,无法反映临床实践中需要连续评估、动态响应患者状态变化的能力。该数据集通过多轮交互式病例模拟真实医患对话,挑战LLM在复杂临床情境中展现信息收集、诊断推理、沟通协作及伦理判断等综合技能。构建过程中面临的挑战包括:从异构的MedEdPORTAL文献中提取并转化为统一的场景化数据包,需保证病例的临床准确性与教学一致性;设计标准化状态转换协议以支持闭环交互,同时确保评分规则的客观性;此外,还需通过临床专家的独立双重评分验证病例与轨迹的可靠性,以克服主观偏差并建立可信的评估基准。
常用场景
经典使用场景
在临床决策能力评估的学术疆域中,MedSP1000数据集被运用于构建动态、多轮交互的标准化病人(SP)诊疗场景,以评测大型语言模型作为临床代理的智能水平。每个病例封装为一个可执行的闭环会话,涵盖临床医生、患者、环境控制器及评估者四个角色代理,并依据ACGME六大核心能力框架进行逐项评分。这一设计突破了传统静态医学问答的局限,使研究者能够量化模型在复杂、演进式临床情境中的推理与决策能力。
解决学术问题
该数据集直击现有医学语言模型评测体系中缺乏标准化、可复现、多轮交互评估工具的痛点。通过引入经同行评审的MedEdPORTAL教学材料作为基础,结合专家定义并经人工校验的评分细则,MedSP1000有效解决了“如何科学度量模型在真实临床推演中的动态表现”这一核心难题。其贡献在于为医疗机构和学术共同体提供了跨17个专科、逾1600例病例的标准化基准,推动临床人工智能评估从静态问答迈向动态场景化评价的新范式。
实际应用
在实际应用中,MedSP1000可作为临床教学与考核的智能化辅助工具,用于自动评估医学生或住院医师在模拟诊疗中的应对表现,帮助识别其六大核心能力短板。同时,医疗AI研发机构可利用该数据集对临床对话系统、智能问诊机器人进行压力测试与能力校准,确保其在实际部署前具备稳健的临床推理与沟通能力。此外,该数据集还能支持ACGME认证培训项目的客观化、标准化评估体系建设。
数据集最近研究
最新研究方向
当前,基于标准化病人(SP)的交互式大语言模型临床评估成为医学人工智能领域的前沿热点。MedSP1000数据集应运而生,它直接脱胎于经同行评审的MedEdPORTAL教学资源,通过构建涵盖17个临床专科的1638个多轮交互病例,并配有24602个基于ACGME六大核心能力的评分条目,为评估LLM在动态临床决策中的表现提供了首个大规模、标准化的闭环基准。该数据集突破了传统静态问答的局限,使临床智能体的诊断推理、沟通协作及系统思维等综合能力得以在更趋真实的诊疗环境中受到检验,对于推动AI辅助医疗系统向高阶自主决策迈进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务