MedProbe
收藏资源简介:
MedProbe是一个专为评估医学问答中线性探针鲁棒性而构建的基准数据集,由阿姆斯特丹大学医学中心团队创建。该数据集包含4000个变体,源自500个MedQA医学事实,每个事实被改写为教科书、患者面向、临床笔记和口语四种语体,并配以正确与错误答案对。数据创建过程借助Claude Sonnet 4.5进行可控重写,并辅以人工审核确保质量。该数据集旨在孤立研究线性探针在语体、医学专业和语料库转移下的泛化能力,为医学NLP的安全监测提供可靠评估工具。
MedProbe is a benchmark dataset specifically developed to evaluate the robustness of linear probes in medical question answering, created by the team at the Amsterdam University Medical Centers. The dataset contains 4,000 variants derived from 500 MedQA medical facts, with each fact rewritten into four distinct styles: textbook, patient-facing, clinical note, and spoken language, paired with both correct and incorrect answer pairs. The dataset creation workflow utilized Claude Sonnet 4.5 for controlled rewriting, supplemented by manual review to ensure data quality. This dataset aims to enable isolated investigation of the generalization capability of linear probes under shifts in text style, medical specialty, and corpus, providing a reliable evaluation tool for safety monitoring in medical natural language processing (NLP).
数据集概述
MedProbe 是一个用于构建医学问答基准(medical-QA benchmark)的代码仓库,该基准通过语域(register)控制来评估开源大语言模型(LLMs)上的**线性真实性探针(linear truthfulness probes)**的鲁棒性,覆盖语域、医学专科和语料库三种变化情境。该工作对应的论文发表于 EMNLP 2026。
核心目标
- 构建一个语域受控的医学问答基准测试集。
- 基于该基准,评估线性探针在以下三种“偏移”下的表现:
- 语域偏移(linguistic register shift)
- 医学专科偏移(medical specialty shift)
- 语料库偏移(corpus shift)
实验模型
共使用四个开源指令微调大语言模型(配置详见 configs/models.yaml):
- Gemma-2-2B
- Gemma-3-4B
- Qwen2.5-7B
- Llama-3-8B
数据构建与评测流程
整个流水线按阶段脚本化执行,每个脚本对应的读写路径由 configs/default.yaml 定义。主要步骤包括:
- 源语料下载:从 MedQA 数据源下载医学问答语料。
- 事实构建:为每条题目采样事实和配对错误答案。
- 语域改写:利用 LLM 生成器将每条事实改写为四种语域变体。
- 质量报告:计算词法层面的语域区分度指标。
- 激活提取:提取每个(模型、层、位置)组合的隐藏状态。
- 自一致性基线:作为输出的自一致性基线。
- 探针训练与评测:训练/评估探针,并对比纯输出基线。
- 消融实验:混合语域及其他相关消融。
- 质量评判:使用 LLM 作为裁判进行质量评估。
- 生成器选择:聚合生成器选择分数。
- 一致性评判:评估多个裁判之间的一致性。
- 校准与误差分析:进行校准(ECE、Platt、等渗回归)及误差分析。
- 跨语料评估:从 MedQA 迁移到 MedMCQA。
此外,还包括若干辅助分析脚本:build_medmcqa_variants.py、run_diff_means_probe.py、run_topic_transfer.py、run_perplexity_per_register.py、tag_specialty.py 等。
引用信息
论文作者:Nishant Mishra、Ameen Abu-Hanna、Iacer Calixto
论文标题:Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA
发表会议:EMNLP 2026





