遇见数据集

MedRealMM

收藏
arXiv2026-07-10 更新2026-07-14 收录
官方服务:

资源简介:

MedRealMM是由京东健康国际有限公司牵头构建的大规模、真实世界中文在线医疗咨询多模态评测基准。该数据集包含5,620例源自全国性互联网医院平台的实际医患交互案例,覆盖64个临床科室,其核心特色在于保留了患者上传的医疗图像与文本对话交织的多模态语境。数据集通过创新的多模态临床挑战点提取框架,从真实咨询轨迹中识别出需要实质性临床推理的关键时刻,并将其转化为标准化的下一轮响应生成任务。该基准旨在精准评估大语言模型在融合视觉与文本信息、遵循临床安全规范、生成开放式诊疗建议等方面的综合能力,为解决人工智能在真实在线医疗场景中可靠性验证的核心瓶颈提供了重要工具。

MedRealMM is a large-scale, real-world Chinese online medical consultation multimodal evaluation benchmark led by JD Health International Inc. This dataset comprises 5,620 real doctor-patient interaction cases sourced from national internet hospital platforms, spanning 64 clinical departments. Its core characteristic is the retention of multimodal context that interleaves medical images uploaded by patients with text-based dialogues. Leveraging an innovative multimodal clinical challenge extraction framework, the dataset identifies critical moments requiring substantive clinical reasoning from authentic consultation trajectories, and converts these into standardized next-round response generation tasks. This benchmark is designed to accurately evaluate the comprehensive capabilities of Large Language Models (LLMs) in fusing visual and textual information, adhering to clinical safety regulations, and generating open-ended diagnostic and treatment recommendations, thereby providing a critical tool to address the core bottleneck of reliability verification for artificial intelligence in real-world online medical scenarios.

创建时间:
2026-07-10
原始信息汇总

数据集概述:MedRealMM

  • 许可证:Apache-2.0

该数据集页面未提供任务类型、数据规模、数据格式或具体用途等详细信息。仅标注了使用 Apache-2.0 开源许可证,允许用户自由使用、修改和分发。

搜集汇总
数据集介绍
构建方式
MedRealMM的构建源于对中国大型互联网医疗平台京东健康真实医患对话数据的深度挖掘。研究者首先从海量原始记录中筛选出包含患者上传医学图像的咨询对话,并在剔除不完整或字数过短的案例后,依据科室分布进行分层抽样以缓解专科偏好偏差。随后,借助大语言模型辅助的脱敏技术去除文本与图像中的个人身份信息,并由经过培训的审查员逐例验证隐私保护效果与临床信息保留程度。为了从多轮对话中提取具有评估价值的片段,团队设计了多模态临床挑战点提取框架,通过两个大语言模型智能体分别评估医生回复的临床参与度与患者图像的临床相关性,最终将原始咨询轨迹截取为自包含的单轮回应生成实例,并保留了完整的文本与图像上下文。
特点
该数据集最显著的特征在于其真实性与多模态性。所有5,620个案例均源自真实的一对一医患互动,而非模拟对话或合成数据,这使得语料自然呈现出真实患者语言的不完整、口语化和碎片化特点,同时囊括了皮肤照片、化验单、处方等患者自拍图像。每个评估实例都配有由大语言模型初版生成、并经执业医师多轮迭代修正的病例专属评分细则,细则中设定了正负向权重指标,奖励恰当的临床行为,并严厉惩罚不安全、无依据或自相矛盾的回复。此外,数据覆盖64个临床科室,并对患者意图与咨询阶段进行了结构化标注,支持分层分析与细致的错误归因。
使用方法
使用MedRealMM时,研究者首先输入截取后的多模态咨询上下文,即包含所有文本与图像信息的患者端消息序列。评估任务要求模型生成医生在后续回合中的回复,而非要求模型回答选择题或匹配标准答案。生成的回复需要与对应病例的医师批准评分细则进行逐条比对,由大语言模型裁判依据严格标准判断每个正负向指标是否被满足,并通过加权聚合计算出每个实例的最终得分。这一基于细则的评估框架支持对开放式临床回复进行多维度量化分析,既能够识别模型在图像理解、诊断推理、治疗建议等方面的优势,也能精准定位其在不安全行为防范上的不足,从而为提升多模态医疗大语言模型的实际部署能力提供可靠参考。
背景与挑战
背景概述
MedRealMM是由京东健康、上海交通大学、新加坡国立大学等多所机构于2026年联合构建的大规模多模态中文在线医疗咨询基准数据集。该数据集源于国内互联网医院平台内真实患者与医生的脱敏交互记录,涵盖64个临床科室,共计5620个案例。其核心研究问题在于评估大型语言模型在真实在线医疗咨询场景中的多模态临床推理能力。MedRealMM的提出弥补了现有基准多依赖合成对话或纯文本的不足,为衡量模型在真实临床环境中的部署准备度提供了可靠标杆,对推动AI辅助医疗诊断的发展具有重要影响力。
当前挑战
MedRealMM所面临的挑战体现在两个方面。一是领域问题层面的挑战,即现有基准大多采用合成对话、纯文本或选择题形式,无法真实反映在线医疗咨询中患者语言碎片化、多模态证据交错以及开放式回答评估的复杂性,尤其缺乏对临床安全性、信息采集充分性及循证推荐等维度的有效衡量。二是数据集构建过程中的挑战,包括从海量真实咨询日志中筛选并脱敏有效案例的隐私保护问题,以及设计多模态临床挑战点提取框架时需精准识别需医生深度参与且涉及图像推理的关键交互节点,同时还需构建经医生反复迭代优化的案例特异性评分标准,确保评估既具临床意义又可扩展。
常用场景
经典使用场景
在智能医疗领域,MedRealMM最经典的使用场景是作为多模态在线医疗咨询的评估基准。该数据集从真实医患对话中提取多模态临床挑战点,保留了患者上传的医学图像,在真实的对话历史背景下,要求模型生成下一轮医生回复。这一设计使得研究者能够评估大语言模型在多轮对话中整合文本与视觉信息进行临床推理的能力,弥补了传统纯文本或模拟对话基准的不足。
衍生相关工作
MedRealMM的提出推动了多项衍生研究:其多模态临床挑战点提取方法启发了后续基于真实轨迹而非模拟的交互式医学评估范式;其医生在环的评分细则构建流程为自动化和临床监督相结合的评估框架树立了典范。此外,该数据集还催生了关于模型在精神病学和中医等特殊科室表现的分析研究,并为跨语言和跨平台的医学AI评估拓展提供了重要参考与基础。
数据集最近研究
最新研究方向
MedRealMM作为首个基于真实医患交互的中文在线医疗多模态基准,聚焦于临床实践中大语言模型(LLM)的部署效能评估。其前沿研究方向集中于三大瓶颈:其一,多模态视觉理解能力,揭示患者上传的影像信息(如皮肤照片、化验单)对模型临床决策至关重要,而现有医学对话基准多排除图像,导致模型在真实场景下性能大幅下降;其二,安全敏感型错误规避,发现前沿模型虽能达成与医生相当的正面临床指标,却因触发更多不安全、无依据或矛盾性负面指标而落后,凸显患者安全是落地关键障碍;其三,细粒度临床阶段适配,模型在病史采集、中医辨证等复杂环节表现薄弱,反映出通用知识迁移至真实在线问诊的鸿沟。该基准推动了从合成数据、选择题评测向真实轨迹、基于病例特异性评分量表的范式转变,为发展临床可落地的多模态医学LLM提供了严苛且可复现的评估标准。
相关研究论文
  • 1
    MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation京东健康国际有限公司; 上海交通大学; 新加坡国立大学; 北卡罗来纳大学教堂山分校; 宾夕法尼亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务