遇见数据集

MedProbe

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

MedProbe是一个专为评估医学问答中线性探针鲁棒性而构建的基准数据集,由阿姆斯特丹大学医学中心团队创建。该数据集包含4000个变体,源自500个MedQA医学事实,每个事实被改写为教科书、患者面向、临床笔记和口语四种语体,并配以正确与错误答案对。数据创建过程借助Claude Sonnet 4.5进行可控重写,并辅以人工审核确保质量。该数据集旨在孤立研究线性探针在语体、医学专业和语料库转移下的泛化能力,为医学NLP的安全监测提供可靠评估工具。

MedProbe is a benchmark dataset specifically developed to evaluate the robustness of linear probes in medical question answering, created by the team at the Amsterdam University Medical Centers. The dataset contains 4,000 variants derived from 500 MedQA medical facts, with each fact rewritten into four distinct styles: textbook, patient-facing, clinical note, and spoken language, paired with both correct and incorrect answer pairs. The dataset creation workflow utilized Claude Sonnet 4.5 for controlled rewriting, supplemented by manual review to ensure data quality. This dataset aims to enable isolated investigation of the generalization capability of linear probes under shifts in text style, medical specialty, and corpus, providing a reliable evaluation tool for safety monitoring in medical natural language processing (NLP).

创建时间:
2026-09-01
原始信息汇总

数据集概述

MedProbe 是一个用于构建医学问答基准(medical-QA benchmark)的代码仓库,该基准通过语域(register)控制来评估开源大语言模型(LLMs)上的**线性真实性探针(linear truthfulness probes)**的鲁棒性,覆盖语域、医学专科和语料库三种变化情境。该工作对应的论文发表于 EMNLP 2026。

核心目标

  • 构建一个语域受控的医学问答基准测试集。
  • 基于该基准,评估线性探针在以下三种“偏移”下的表现:
    • 语域偏移(linguistic register shift)
    • 医学专科偏移(medical specialty shift)
    • 语料库偏移(corpus shift)

实验模型

共使用四个开源指令微调大语言模型(配置详见 configs/models.yaml):

  • Gemma-2-2B
  • Gemma-3-4B
  • Qwen2.5-7B
  • Llama-3-8B

数据构建与评测流程

整个流水线按阶段脚本化执行,每个脚本对应的读写路径由 configs/default.yaml 定义。主要步骤包括:

  1. 源语料下载:从 MedQA 数据源下载医学问答语料。
  2. 事实构建:为每条题目采样事实和配对错误答案。
  3. 语域改写:利用 LLM 生成器将每条事实改写为四种语域变体。
  4. 质量报告:计算词法层面的语域区分度指标。
  5. 激活提取:提取每个(模型、层、位置)组合的隐藏状态。
  6. 自一致性基线:作为输出的自一致性基线。
  7. 探针训练与评测:训练/评估探针,并对比纯输出基线。
  8. 消融实验:混合语域及其他相关消融。
  9. 质量评判:使用 LLM 作为裁判进行质量评估。
  10. 生成器选择:聚合生成器选择分数。
  11. 一致性评判:评估多个裁判之间的一致性。
  12. 校准与误差分析:进行校准(ECE、Platt、等渗回归)及误差分析。
  13. 跨语料评估:从 MedQA 迁移到 MedMCQA。

此外,还包括若干辅助分析脚本:build_medmcqa_variants.pyrun_diff_means_probe.pyrun_topic_transfer.pyrun_perplexity_per_register.pytag_specialty.py 等。

引用信息

论文作者:Nishant Mishra、Ameen Abu-Hanna、Iacer Calixto
论文标题:Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA
发表会议:EMNLP 2026

搜集汇总
数据集介绍
MedProbe 数据集图片
构建方式
MedProbe基准数据集源于对医学问答中线性探针鲁棒性的深入探究。其构建以MedQA测试集中的500个问题为基底,每个问题附带一个正确与一个错误选项,经由Claude Sonnet 4.5模型改写为四种语言语域(教科书式、患者式、临床笔记式、口语式),并辅以Gemini模型进行交叉验证。每个事实对由此生成4,000个受控变体,确保正误标签保真。数据据S-MedQA标注映射至15个临床专科,同时整合MedMCQA与MMLU-medical作为跨语料评估集,并引入MedRedQA人类书写问题,以多层次、多维度地剖析输入变化对探针的影响。
特点
MedProbe的特色在于其精细的三轴解耦设计,能够独立区分语域、医学专科与语料库三类输入变化,从而厘清先前研究中混杂的转移效应。基准内含4,000个重写变体,在事实层面划分训练与测试,避免信息泄漏。其评估集涵盖了不同语言风格、专科归属及源语料,并配合人类真实患者书写文本,使得对线性探针泛化能力的测量既全面又严谨。此外,通过全套提示词、评判准则与代码的公开,MedProbe为后续研究提供了高度可复现的基准平台。
使用方法
使用MedProbe时,研究者可依据实验目的选取特定子集。训练线性探针通常采用教科书语域的变体,在冻结的大语言模型隐藏状态上进行L2正则化逻辑回归,并基于预留事实集评估其在各语域下的表现。若要隔离专科效应,可利S-MedQA标注,在训练与测试专科不相交的划分下进行探针迁移测验。跨语料评估则直接使用在MedQA上训练的探针,在MedMCQA与MMLU-medical上零样本测试,从而量化语料偏移带来的性能衰退。所有评估指标聚焦于AUROC,并辅以置信区间与校准分析,以确保能可靠地对比不同条件下的泛化能力。
背景与挑战
背景概述
MedProbe数据集由阿姆斯特丹大学医学信息学系的研究人员于2026年创建,旨在系统解构医学问答中线性探针(linear probe)的泛化行为。该数据集基于500条MedQA题目,通过Claude Sonnet 4.5和Gemini 3 Flash两种生成器,将每条题目改写为教科书、患者、临床笔记和口语化四种语体变体,并附有临床专科标注,构建了4000个受控改写样本。研究核心问题在于分离语体、医学专科和语料库三种输入变化对线性探针'真实方向'鲁棒性的独立影响,以解决该领域先前实验设计混杂的争议。该数据集对可解释性研究具有重要影响力,提供了第一个在医学问答领域隔离多重变量、可供跨语料库评估的标准化基准,为线性探针作为事实性监测工具的部署边界提供了实证依据。
当前挑战
该领域的核心挑战在于线性探针'真实方向'的稳定性尚存争议,先前跨数据集研究将语体、专科、语料库等多种变化因素混杂,难以归因性能下降的具体来源,此为需解决的首要领域难题。构建过程中面临多重困难:改写生成器需在保证医学正确性不泄露的前提下维持错误答案的迷惑性,需设计双重极性保留的受控提示以避免无意的标签修复;语体间风格差异显著,临床笔记和口语化的困惑度较教科书基线高出6-7倍,考验改写保真度与标签忠实度的平衡;跨语料库评测需排除题目格式、专科分布和干扰项风格等混淆因素,依靠消除法和对照集设计来定位语料库转移的归因来源。
常用场景
经典使用场景
MedProbe数据集聚焦于医学问答中线性探针的鲁棒性评估,其经典使用场景在于系统性地隔离并量化输入变化对探针性能的影响。该数据集通过将500道MedQA题目改写成教科书式、患者式、临床记录式和口语式四种语言风格,并配套临床专科标注及跨语料库样本(MedMCQA、MMLU-medical),为研究者提供了一种精细的基准工具。在实验中,研究者可借助该数据集分别考察写作风格、医学专科和数据源三种独立变量下的探针迁移能力,从而避免了以往跨数据集评估中多种因素混杂、难以归因的方法论困境。
实际应用
在实际应用中,MedProbe数据集为部署线性探针作为医学语言模型事实性监控工具提供了关键操作指南。研究结果表明,在特定语料库内训练的探针可作为有效的分发内安全监测器,但绝不可零样本部署到新语料库,这使医疗AI系统开发者在设计临床决策支持时需严格限定探针的应用范围。此外,该数据集揭示了原始探针分数校准不良的问题,强调在实际系统里必须配置事后校准层,如Platt缩放,以确保输出置信度可用。这些洞见直接指导了医学QA系统安全模块的构建,防范误导性医疗信息对临床决策造成危害。
衍生相关工作
MedProbe数据集催生了若干重要后续研究。其核心结论——线性真实方向在语域迁移中稳健而跨语料库易碎——与Marks和Tegmark的差异均值探针、Bürger等的谎言普遍性研究以及Levinstein和Herrmann的怀疑论形成互补,促使其他团队探索二维真值子空间来修复否定模式失败。同时,该数据集的受控重写方法启发了诸如注意力图谱频谱特征探针和长文本生成探针的工作,后者发现长文本训练的探针可迁移至短问答而反向不成立。此外,混合语域训练能部分弥合迁移差距的发现,直接为后续数据增强和探针训练策略提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务