遇见数据集

disi-unibo-nlp/MedQAbstain

收藏
Hugging Face2026-06-24 更新2026-07-22 收录
官方服务:

资源简介:

MedQAbstain是一个用于评估大语言模型(LLMs)在医学不确定性下弃权(abstention)能力的基准数据集。它通过改造现有的医学多项选择题(MCQA)数据集,移除原始正确答案并添加明确的我弃权选项(例如升级给其他医生),从而将问题转化为仅允许弃权的决策问题。该数据集旨在测试模型在缺乏安全行动选择时是否能够避免采取不安全行动。数据集包含两个子集:Safe(安全)和LT(Life-Threatening,生命威胁),分别对应不同临床风险级别。支持文本和多模态输入,并提供两种弃权设置:Trivial Abstention(隐藏问题,仅显示选项)和Standard Abstention(显示完整问题和选项)。此外,还提供针对推理型和非推理型模型的提示变体。数据集字段包括ID、来源数据集、问题文本、选项、答案索引、图像、模态类型、原始选项、原始答案以及多种提示字段。

MedQAbstain is a benchmark dataset for evaluating the abstention capability of Large Language Models (LLMs) in the context of medical uncertainty. It is constructed by modifying existing medical multiple-choice question answering (MCQA) datasets: removing the original correct answer and adding an explicit "I abstain" option (e.g., "consult another physician"), thereby transforming the original task into a decision-making problem where abstention is the only permissible action. The core goal of this dataset is to test whether models can refrain from taking unsafe actions when no safe operational alternatives are available. The dataset includes two subsets: Safe and LT (Life-Threatening), which correspond to different clinical risk levels. It supports both textual and multimodal inputs, and provides two abstention settings: Trivial Abstention (hide the question and only display options) and Standard Abstention (display the complete question and options). Additionally, prompt variants tailored for reasoning and non-reasoning models are provided. The dataset fields include ID, source dataset, question text, options, answer index, image, modality type, original options, original answer, and multiple prompt fields.

提供机构:
disi-unibo-nlp
搜集汇总
数据集介绍
disi-unibo-nlp/MedQAbstain 数据集图片
构建方式
MedQAbstain通过改造现有的医学多项选择问答数据集来构建,其核心策略是将原始正确答案从选项集合中移除,并显式加入一个“我放弃回答”的选项,从而使得放弃回答成为唯一合理的决策。该数据集从源头数据集继承了问题、选项、图像等原始字段,并新增了原始答案与选项的保留字段,以及针对不同推理类型模型定制的提示词字段。根据临床决策错误的潜在严重程度,数据集被划分为“安全”与“危及生命”两个子集,以便分层分析模型在不同风险程度下的放弃行为。
特点
该数据集的核心特点在于其对医学大语言模型安全决策能力的评估聚焦于“医疗放弃”而非“认知放弃”,强调在信息不完全或行动不安全时拒绝采取动作的重要性。数据集设计了两类评估场景:“标准放弃”模型可看到完整问题与选项,但正确答案被移除;“琐碎放弃”则隐藏问题本身,仅展示选项。这种设置能够系统性地揭示模型在不确定性下的过度承诺倾向,并通过自报告置信度分析来衡量模型的校准能力。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,使用load_dataset函数获取“LT”和“Safe”两个数据子集。每个样本都预置了面向推理型与非推理型模型的提示词,用户可直接利用这些提示词构建输入并调用所选模型进行推理。数据集同时支持纯文本与多模态输入,多模态样本的图像需额外从HuggingFace仓库下载。评估时仅需将模型输出与预设的放弃选项索引进行比对,即可判断模型是否正确放弃了回答。
背景与挑战
背景概述
MedQAbstain是一个于2026年提出的医学大语言模型(LLM)安全评估基准,由Alessio Cocchieri、Luca Ragazzi等研究人员在博洛尼亚大学自然语言处理实验室(DISI)开发。该数据集的核心研究问题聚焦于LLM在临床不确定性下是否具备恰当的医学弃权(Medical Abstention)能力——即当所有可用选项均不构成安全行动时,模型能否抑制回答冲动、选择不行动。传统医学多选题问答(MCQA)基准隐含鼓励模型始终回答,而MedQAbstain通过移除原正确选项并加入明确的“弃权”选项,将评估从简单的知识正确性转向安全决策。该工作发表于ACL 2026长文,对临床AI的安全部署具有深刻影响。
当前挑战
MedQAbstain解决的领域核心挑战是LLM在医学决策中的过度自信与不当承诺(Overcommitment)。尽管弃权在临床中往往是安全且负责任的行为,但现有模型无论面对明确问题还是隐藏信息,都几乎从不弃权。该数据集的构建挑战包括:第一,如何从标准MCQA实例中合理转化,使弃权成为唯一正确选项而非简单回避问题;第二,如何通过临床风险标注划分安全(Safe)与危及生命(Life-Threatening)两个层次,以揭示不同风险下的模型行为差异;第三,设计两种控制设置(Trivial和Standard Abstention)将信息完整度与决策依据分离,从而系统评估模型内部置信度与行为的不匹配程度。这些挑战使得MedQAbstain不仅是评测工具,更是揭示LLM对齐临床安全规范关键缺口的诊断器。
常用场景
经典使用场景
MedQAbstain的核心用途在于评估大型语言模型在医学不确定性场景下的弃权能力。该数据集通过将标准医学多项选择题中的正确答案移除,并引入明确的'我弃权'选项,将传统的知识正确性评估转变为对模型在缺乏安全行动选项时是否能够做出安全决策的测试。这一设计使其成为评估医学AI安全性的重要基准。
衍生相关工作
该数据集衍生的经典工作包括针对医学不确定性下的弃权机制研究,特别是区分认知弃权(因缺乏知识而不回答)与医学弃权(因行动不安全而拒绝行动)的类别定义。相关工作还探索了不同的提示策略(如标准弃权与平凡弃权)对模型行为的影响,以及推理模型与非推理模型在弃权行为上的表现差异,促进了更加安全的医学AI系统设计方法论。
数据集最近研究
最新研究方向
在医疗大语言模型的安全部署领域,近期研究焦点已从单纯的问答准确率转向模型在不确定性下的“弃权”能力评估。MedQAbstain数据集应运而生,它开创性地将传统医学多项选择问答重新框架化为仅含弃权选项的决策难题,通过移除标准答案并加入临床场景中“向上级医师求助”的弃权选项,精准暴露了前沿模型在医学不确定性面前系统性过度承诺的致命缺陷。这一方向紧密关联医疗AI安全事件频发的现实热点,通过生命威胁性与安全性两个层级的风险标注,为剖析高 stakes 下模型行为提供了结构化分析工具,其研究成果直接质疑了现行基准的合理性,推动了从“知识正确性”向“临床安全决策”评估范式的根本性变革,对构建真正可信的临床决策支持系统具有里程碑式的指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务