遇见数据集

ThReadMed-QA

收藏
arXiv2026-07-14 更新2026-07-16 收录
官方服务:

资源简介:

ThReadMed-QA是由东北大学·科里计算机科学学院创建的多轮医疗对话数据集,旨在评估大语言模型在真实患者互动中识别和纠正误解的能力。该数据集包含2,437个对话线程和8,204个问答对,数据来源于Reddit的r/AskDocs子论坛,覆盖了2015年至2023年间的患者与医生自然交互,平均患者提问长度为129个tokens,医生回复为75个tokens。其构建过程通过筛选原始帖子、预处理、提取患者与医生对话分支,并过滤低质量内容,最终保留完全回答的线程。该数据集主要应用于医疗人工智能领域,旨在解决大语言模型在连续对话中处理患者误解的可靠性问题,为评估模型在多轮互动中的安全性和一致性提供基准。

ThReadMed-QA is a multi-turn medical dialogue dataset created by Khoury College of Computer Sciences, Northeastern University, aiming to evaluate the ability of Large Language Models (LLMs) to recognize and correct misunderstandings during real patient interactions. This dataset contains 2,437 dialogue threads and 8,204 question-answer pairs, sourced from the r/AskDocs subreddit of Reddit, covering natural patient-doctor interactions between 2015 and 2023, with an average length of 129 tokens for patient queries and 75 tokens for physician responses. Its construction pipeline includes screening original posts, preprocessing, extracting patient-doctor dialogue branches, filtering low-quality content, and ultimately retaining fully answered dialogue threads. This dataset is primarily applied in the field of medical artificial intelligence, aiming to address the reliability issues of LLMs when handling patient misunderstandings in continuous conversations, and providing a benchmark for evaluating the safety and consistency of models in multi-turn interactions.

创建时间:
2026-07-14
搜集汇总
数据集介绍
ThReadMed-QA 数据集图片
构建方式
ThReadMed-QA 数据集源自 Reddit 社区 r/AskDocs 上真实患者与医师之间的多轮对话。研究团队收集了 2015 年 1 月至 2023 年 6 月期间的帖子,经过标准预处理去除低质量和已删除内容后,通过保留原始发帖人与已验证医师之间的交互,构建线性对话线程。每条线程至少包含两个追问,从而确保多轮结构。最终,通过筛选出所有问题均有医师回复的完整对话子集,获得了包含 2,437 条对话线程、共计 8,204 个问答对的数据集。这一构建方式忠实地保留了患者反复寻求医学指导的自然过程。
特点
该数据集具有鲜明的特点,它首次将患者提出的真实问题、自然衍生的追问以及经医师验证的答复整合在一个评估框架之中。与以往仅关注单轮或合成数据的医学问答资源不同,ThReadMed-QA 能够捕捉患者在多次交互中逐渐暴露、持续或演变的误解。其对话深度从数个追问到九个不等,患者提问平均包含约 142 个词元,而医师回答则更为精炼(约 70 词元),这种不对称性如实反映了临床沟通中患者信息寻求与专业指导之间的动态。
使用方法
ThReadMed-QA 专为评估大语言模型在多轮医学对话中识别与纠正患者误解的能力而设计。使用时,模型以零样本方式依次接收完整的对话历史(包括患者先前的问题与模型自身的回答),并生成对当前问题的回复。研究采用基于评分规则的 LLM-as-a-Judge 框架,对模型回答按三个层级评分:未能识别误解(-1)、部分识别但未完全纠正(0)和精准识别并纠正(1),以计算误解纠正率。此外,通过替换历史回复为医师金标答案的消融实验,可单独分析错误传播与内在难度对性能退化的影响。
背景与挑战
背景概述
ThReadMed-QA数据集由美国东北大学的Monica Munnangi与Saiph Savage于2026年构建,聚焦于大语言模型在多轮医疗对话中识别与纠正患者误解的能力。临床实践中,患者常提出隐含错误假设的问题,而安全沟通要求模型不仅作答,更需辨识并修正背后的谬误。现有基准如MedQA、PubMedQA偏重单轮事实回忆,缺乏对患者真实交互中误解动态演变特性的评估。该数据集基于Reddit的r/AskDocs论坛,提取了2,437条真实医患对话线程(含8,204个问答对),系首个同时包含患者自拟问题、多轮交互与医生验证回复的医学问答资源,为评估模型在对话持续过程中的误解处理能力提供了关键基准,深刻揭示了单轮表现优异者未必能在多轮中维持可靠性这一核心挑战。
当前挑战
该数据集面临的挑战可从领域问题与构建过程两方面剖析。在领域层面,其核心挑战是医疗场景下患者误解具有隐性和动态性:错误预设常隐含于问题之中,且随对话演进可能持续、转移或加深。现有模型虽能在初始轮次以约85%的概率纠正误解,但在后续两轮内骤降至约50%,错误传播与恢复能力不足成为瓶颈。在构建过程中,挑战包括从海量帖子中精准筛选出经身份验证的医生回复分支,利用词重叠启发式算法保留主题一致的多轮线程,以及处理未答随访问题(孤儿节点)以确保完整评估子集的质量。此外,依赖LLM-as-a-Judge进行误解标注与评分时,尽管取得了与专家医师90%的一致性,仍需克服潜在标记噪声对下游指标的影响。
常用场景
经典使用场景
ThReadMed-QA 的核心设计使其成为评估多轮对话场景下大语言模型医疗安全性的理想基准。该数据集源自 Reddit 论坛 r/AskDocs 中真实的患者-医生交互,包含 2,437 个完整对话线程及 8,204 个问答对,天然具备患者自发提问、医生验证回答以及多轮追问的结构。研究者可借此系统性地考察模型在多轮语境中是否能够持续识别并纠正患者问题中隐含的错误预设或医学误解,而非仅在单轮查询中表现良好。这一场景精准地还原了现实中医患沟通的迭代本质,为量化语言模型在动态交互中的事实性与安全性提供了无可替代的测试平台。
衍生相关工作
ThReadMed-QA 的发布催生了一系列围绕多轮医疗对话鲁棒性的衍生研究。在其基础上,研究者们开始系统性地探索模型在多轮交互中的‘安全漂移’现象,开发基于错误传播动力学的诊断框架,以定量刻画模型在对话各轮次中维持事实性与安全指引的衰退轨迹。此外,该数据集也激发了关于对话错误恢复机制的研究:即模型在初次未能识别误解后,能否在后续轮次中重新正确认知并纠正该误预设。数据集中明确揭示的‘恢复率’(Recovery Rate)指标,启发了针对性的微调策略与对齐方法,例如通过强化学习奖励模型在多轮语境中持续保持正确前提的生成行为,或是引入外部知识库在每轮对话中进行事实锚定,从而有效遏制错误的链式累积。
数据集最近研究
最新研究方向
ThReadMed-QA数据集聚焦于多轮医疗对话中大型语言模型对患者错误预设的识别与纠正能力,揭示了前沿模型虽在单轮交互中表现优异,但在对话延续后矫正率急剧下降——GPT-5和Claude Haiku从初始约85%跌至第二轮约50%,GPT-4o更从65%骤降至21%。这一发现与当前患者日益依赖大模型获取医疗资讯的热点事件紧密关联,凸显了安全对话中错误传播与恢复能力缺失的严峻挑战。研究通过引入专家对话作为参照,证实大部分退化源于模型自身错误的累积,而非单轮问题难度,为设计交互式安全评估框架提供了关键依据,推动医疗AI从静态问答走向动态可靠性验证。
相关研究论文
  • 1
    Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations东北大学·科里计算机科学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务